Memoria de corto plazo en agentes IA: cómo gestionar el contexto sin reventar tokens
Estrategias de memoria de corto plazo para agentes LLM: últimos N turnos, presupuesto de tokens y resumen incremental. Cómo elegir según costo, latencia y largo de conversación.
El contexto es probablemente el recurso más escaso cuando construyes un agente.
No porque falte información, sino porque no puedes enviarla toda.

La ventana de contexto tiene un límite y cada token cuesta. En cada turno hay que decidir qué parte de la conversación viaja al modelo y cuál se queda fuera. Esa decisión, en la práctica, define la memoria de corto plazo. Es una de las capas del harness que rodea al modelo y le da capacidad de acción real.
Revisé varias estrategias para resolverlo y ninguna gana siempre.
Últimos N turnos
Guardas los últimos 10 mensajes y listo. Barato, rápido y fácil de razonar. El precio es que todo lo anterior desaparece. Funciona bien para conversaciones cortas y transaccionales, como agendar una reunión o responder una duda puntual.
Presupuesto de tokens
En lugar de contar mensajes, llenas el contexto hasta un límite de tokens con lo más reciente. Se adapta mejor al costo y al modelo, sin cortar conversaciones de forma arbitraria. Buen punto de partida cuando el largo de las conversaciones es impredecible.
Resumen incremental
Cuando la conversación crece, el historial antiguo se resume en un bloque que conserva lo importante, mientras los últimos turnos permanecen íntegros. Una conversación de 80 mensajes sigue teniendo continuidad sin reventar la ventana. Cuesta un poco más, así que el resumen se cachea y se actualiza de a poco.
Si el usuario necesita recuperar algo muy específico de hace 40 turnos, el corto plazo deja de ser suficiente. Ahí entra otro problema: la memoria de largo plazo.
¿Cómo elijo?
Termino evaluando cuatro cosas: qué tan largas son las conversaciones, cuánto importa el costo, cuánta latencia puedo aceptar y qué tan grave es perder el hilo. Un flujo para agendar vive bien con ventana fija. Un asistente que acompaña por semanas necesita resumen. Si el costo manda, presupuesto de tokens.
Al final terminé usando una estrategia híbrida: resumen de lo antiguo más los últimos turnos completos. Lo reciente conserva toda su precisión, lo anterior sigue presente aunque comprimido. Ni ventana pura ni resumen absoluto. También esto se complementa con las estrategias de memoria a largo plazo.
Lo difícil no es resumir. Es decidir cuándo empezar, cuántos mensajes dejar íntegros y cuánto detalle sacrificar sin perder el hilo.
La memoria de corto plazo no consiste en recordar más. Consiste en recordar lo necesario, con el menor costo posible.
¿Qué estrategia usan ustedes? ¿Ventana fija, presupuesto de tokens, resumen incremental o alguna combinación distinta?
#LLM #AIAgents #Chatbots