Del entorno de pruebas a la infraestructura
El entorno de pruebas de IA creció hasta convertirse en un laboratorio local dedicado: la inferencia, la capa de aplicación y el entorno de agentes tienen responsabilidades separadas. Busco un sistema que pueda inspeccionar y recuperar, manteniendo el control de mis datos privados.
Open WebUI ofrece la interfaz de chat. LiteLLM funciona como pasarela. Ollama se encarga de la inferencia local. La capa de conocimiento indexa documentación seleccionada del laboratorio para que las respuestas puedan remitirse a material que realmente mantengo.
Límites que vale la pena conservar
- La inferencia en GPU está separada de los servicios de chat y base de datos.
- El entorno de agentes expone herramientas de infraestructura de solo lectura.
- Un paso independiente de depuración, basado en reglas, prepara el texto de diagnóstico para pedir asistencia externa.
- Las trazas y la evaluación acompañan al modelo para no confundir una respuesta plausible con una verificada.
La parte menos vistosa
La asignación directa de la GPU a la máquina virtual ha sido el fallo más ligado al hardware. La máquina invitada puede dejar de responder mientras la interfaz de virtualización sigue mostrándola en ejecución. Recuperar el servicio de modelos se convierte entonces en un problema de hardware, no de instrucciones al modelo.
El modelo local pequeño también tiene límites. Puede responder bien una pregunta concreta y aun así elegir la herramienta equivocada entre varias opciones. Tener acceso a herramientas, recuperar información pertinente y tomar buenas decisiones son cosas distintas.
Lo próximo en el taller
Evaluaciones más repetibles, mejor enrutamiento de modelos y observabilidad con un alcance definido. Es un experimento personal en desarrollo activo, no una afirmación de que esté listo para gestionar datos ajenos en producción.