Mi primer chatbot con IA (Marzo 2023): Alucinaciones, descubrimientos y 31 meses de evolución
Cómo construí mi primer chatbot con GPT-3.5-turbo, descubrí las alucinaciones antes de que tuvieran nombre, y qué aprendí en 31 meses de evolución.
Ver publicación original en LinkedIn ↗Los primeros pasos: early adopter en territorio desconocido
El 1 de marzo de 2023, OpenAI lanza la API de GPT-3.5-turbo. Pocas semanas después, construí mi primer chatbot conectado a un LLM, convirtiéndome en early adopter experimentando esta tecnología en tiempo real.
Mi primera consulta personal fue: “cómo manejar las pataletas en los niños” (aplicable a mis hijas pequeñas). La respuesta fue coherente y estructurada, pero marcó el inicio del aprendizaje sobre las limitaciones de estos sistemas.
Mientras esperaba acceso a GPT-4 (recibido el 27 de marzo), trabajaba con GPT-3.5-turbo bajo restricciones: 4K tokens de contexto (aproximadamente 3,000 palabras), sin acceso a internet, y latencias de 3-5 segundos por respuesta.
El desafío: construir con limitaciones
Implementé dos estrategias:
- localStorage: Almacenaba los últimos 10 mensajes del navegador
- Base de datos SQL: Registraba cada consulta con respuesta completa del modelo, permitiendo validación posterior y respuestas cacheadas sin costo
El chatbot se viralizó rápidamente entre redes sociales, amigos y alumnos universitarios. En marzo de 2023, acceso a esta tecnología era novedoso.
El descubrimiento: alucinaciones
Revisando sistemáticamente la base de datos, hallé respuestas ficticiamente plausibles. Un ejemplo crítico: una pregunta sobre “Talcahuano” generó etimología mapuche detallada con “fechas específicas” e interpretaciones históricas, completamente inventadas.
Hallé múltiples casos similares: orígenes de apellidos inventados, explicaciones técnicas con datos incorrectos, fechas históricas falsas — todas presentadas con absoluta convicción.
En marzo de 2023 desconocía el término “alucinaciones”. Este descubrimiento cambió mi comprensión completa: no estaba con una base de datos que devuelve hechos verificables, sino con un sistema probabilístico que genera texto convincente.
La evolución: 31 meses (Marzo 2023 - Octubre 2025)
| Métrica | Antes | Después |
|---|---|---|
| Contexto | 4K tokens | 128K-400K tokens (32-100x más) |
| Velocidad | 3-5 segundos | 1-2 segundos |
| Alucinaciones | ~25% de error factual | ~11% (55% reducción) |
| Capacidades | Solo texto | Multimodal (imagen, audio, video) |
| Acceso a Internet | Sin acceso | Búsqueda en tiempo real |
| Conocimiento | Septiembre 2021 | Junio 2024 + búsqueda online |
| Frameworks | 2 herramientas beta | 9+ ecosistemas maduros |
Aprendizajes principales
-
Validación humana no negociable. Almacenar las respuestas en una base de datos para validarlas después fue lo que me permitió descubrir las alucinaciones.
-
Impacto en confianza del usuario. Una sola respuesta verificablemente falsa puede destruir la confianza en todo el sistema.
-
Arquitectura sobre potencia. Base de datos SQL, caché con localStorage, optimización de contexto siguen siendo cruciales en escenarios de alto volumen.
-
Evolución exponencial. Los constructores deben diseñar asumiendo multiplicación de capacidades, no solo incrementos.
Conclusión
Ser early adopter significaba descubrir problemas que aún no tenían nombre. Pero también significaba entender desde el inicio que estos sistemas requieren arquitectura cuidadosa, validación constante y diseño consciente.