“El descuento del 15% que mencioné antes.” El cliente lo dijo al principio de una conversación larga con un agente de atención automatizado. Veinte turnos después, el agente responde con un número distinto. Nadie cambió nada a propósito. El dato simplemente se perdió en el camino.

En síntesis

  • Las conversaciones largas con agentes de IA suelen comprimirse para no exceder el límite de contexto del modelo.
  • Esa compresión es imprecisa por naturaleza en números, fechas y compromisos textuales — no es un bug puntual, es una propiedad de resumir información.
  • La solución no es resumir mejor. Es sacar los hechos críticos del resumen y mantenerlos aparte, intactos.
  • Es uno de los criterios que evaluamos cuando auditamos sistemas conversacionales de larga duración.

Por qué un agente “olvida” algo que sí dijiste

Los modelos de lenguaje tienen un límite de cuánto texto pueden procesar de una vez. Cuando una conversación se extiende, un sistema típico resume el historial anterior para no superar ese límite, conservando solo lo esencial. El problema es que “resumir” y “preservar con exactitud” no son la misma operación. Un resumen puede capturar perfectamente el tema general de una conversación —“se discutieron precios promocionales”— y aun así perder el número exacto que se mencionó una sola vez, veinte turnos atrás.

Esto no es un error del modelo de resumen en particular. Es una propiedad estructural de comprimir información: cuanto más se condensa un texto, más se sacrifican los detalles específicos a favor del sentido general. Un dato numérico mencionado una sola vez, en medio de una conversación larga, es exactamente el tipo de detalle que un resumen tiende a perder.

La solución no es resumir mejor

La tentación es intentar arreglar esto ajustando cuándo o cómo se resume: resumir con menos frecuencia, o pedirle al modelo de resumen que “preserve los números importantes”. Ninguna de las dos ataca la causa real. Resumir con menos frecuencia solo retrasa el momento en que el problema aparece. Confiar en que el resumen preserve números textualmente depende, de nuevo, de que un modelo siga una instrucción de forma consistente — el mismo problema de fondo que aparece cada vez que se le pide a un sistema probabilístico que garantice algo con precisión perfecta.

La solución que funciona es distinta en naturaleza: extraer los hechos transaccionales —montos, fechas, identificadores, compromisos concretos— a un bloque de datos persistente, separado del historial que se resume, y reinyectarlo completo en cada turno de la conversación. Ese bloque nunca pasa por el proceso de compresión. Sobrevive intacto a cualquier cantidad de turnos, porque nunca depende de que un resumen lo recuerde bien.

Un fenómeno relacionado: perderse en el medio

Hay una segunda forma en la que las conversaciones largas fallan, más allá de la sumarización: cuando se agrega mucha información de una sola vez —el resultado combinado de varias búsquedas o consultas, por ejemplo— el modelo tiende a prestarle buena atención al principio y al final de ese bloque, pero pasa por alto lo que queda en el medio. Es un fenómeno documentado en investigación académica desde 2023 (“lost in the middle”), no una anécdota aislada. La mitigación es simple una vez que se conoce el patrón: poner lo más importante al principio del bloque, y usar títulos o secciones claras para que el modelo pueda ubicarse dentro del contenido largo en vez de tener que procesarlo todo de corrido.

Por qué esto es parte de una auditoría seria

En Arteclaw ayudamos a organizaciones a adoptar arquitecturas agénticas de forma segura. Como parte de ese trabajo, sometemos sistemas —los nuestros y los de las organizaciones que asesoramos— a auditorías periódicas contra un framework propio, informado por los criterios de la certificación oficial de arquitectos de Claude de Anthropic. La gestión de contexto en conversaciones largas es, en nuestra experiencia, uno de los puntos donde más se subestima el riesgo: el sistema parece funcionar bien en pruebas cortas, y el problema solo aparece cuando un caso real se extiende más de lo esperado.

La pregunta que conviene hacerse

Si tu sistema mantiene conversaciones largas con clientes o usuarios, la pregunta que vale la pena hacerse es: los datos que de verdad importan —montos, fechas, compromisos— ¿dependen de que un resumen los recuerde bien, o viven en un lugar que ninguna compresión puede tocar? Si dependen del resumen, es cuestión de tiempo hasta que alguien note la diferencia.


Inspirado en la serie de BridgeIntoAI sobre la certificación oficial Claude Certified Architect Foundations de Anthropic.