← Proyectos / índice

Laboratorio de infraestructura de IA

Modelos locales, una base de conocimiento privada y un entorno de pruebas con herramientas de solo lectura. Un sistema de IA doméstico, incluidas las partes que fallan.

Laboratorio personal / en desarrolloRegistro público /
FACKO / RESPONSABILIDADES01Interfaz02Pasarela de modelos03Inferencia GPUESQUEMA / VERSIÓN PÚBLICA
  1. 01Interfaz
  2. 02Pasarela de modelos
  3. 03Inferencia GPU
Recorrido simplificado de una solicitud. La recuperación de conocimiento y las herramientas de solo lectura son servicios de apoyo separados; no es un mapa de red.

Del entorno de pruebas a la infraestructura

El entorno de pruebas de IA creció hasta convertirse en un laboratorio local dedicado: la inferencia, la capa de aplicación y el entorno de agentes tienen responsabilidades separadas. Busco un sistema que pueda inspeccionar y recuperar, manteniendo el control de mis datos privados.

Open WebUI ofrece la interfaz de chat. LiteLLM funciona como pasarela. Ollama se encarga de la inferencia local. La capa de conocimiento indexa documentación seleccionada del laboratorio para que las respuestas puedan remitirse a material que realmente mantengo.

Límites que vale la pena conservar

  • La inferencia en GPU está separada de los servicios de chat y base de datos.
  • El entorno de agentes expone herramientas de infraestructura de solo lectura.
  • Un paso independiente de depuración, basado en reglas, prepara el texto de diagnóstico para pedir asistencia externa.
  • Las trazas y la evaluación acompañan al modelo para no confundir una respuesta plausible con una verificada.

La parte menos vistosa

La asignación directa de la GPU a la máquina virtual ha sido el fallo más ligado al hardware. La máquina invitada puede dejar de responder mientras la interfaz de virtualización sigue mostrándola en ejecución. Recuperar el servicio de modelos se convierte entonces en un problema de hardware, no de instrucciones al modelo.

El modelo local pequeño también tiene límites. Puede responder bien una pregunta concreta y aun así elegir la herramienta equivocada entre varias opciones. Tener acceso a herramientas, recuperar información pertinente y tomar buenas decisiones son cosas distintas.

Lo próximo en el taller

Evaluaciones más repetibles, mejor enrutamiento de modelos y observabilidad con un alcance definido. Es un experimento personal en desarrollo activo, no una afirmación de que esté listo para gestionar datos ajenos en producción.

Leer la nota de trabajo ↗

Directorio del archivo

Escribí para filtrar. ↑ ↓ para moverte. Enter para abrir.