Un Mundo Loco ●

La memoria de trabajo de la IA tiene un borde, aunque parezca recordar todo

Persona selecciona fichas en blanco para ubicarlas dentro de un espacio de trabajo limitado junto a una computadora cerrada
Recreación editorial generada con IA de una memoria de trabajo limitada: algunas fichas entran y otras quedan fuera.Crédito: Recreación editorial generada con IA
Escuchar nota Lectura por voz
— min
1x

Entender qué es la ventana de contexto de una IA permite saber cuánto material puede considerar un modelo de lenguaje al redactar una respuesta. Es su espacio de trabajo temporal: reúne las instrucciones del sistema, la pregunta actual, los mensajes anteriores, los documentos adjuntos y el texto que está generando. No contiene todo lo aprendido durante el entrenamiento ni equivale a una memoria personal permanente. Cuando ese espacio se llena, parte de la conversación debe salir, resumirse o comprimirse.

El mecanismo moderno tiene un origen preciso. El 12 de junio de 2017, ocho investigadores publicaron Attention Is All You Need, el trabajo que presentó la arquitectura Transformer basada en atención. Siete años después, un estudio de Nelson F. Liu y otros seis autores, publicado en 2024 en Transactions of the Association for Computational Linguistics, mostró el límite práctico: los modelos evaluados solían recuperar mejor la información ubicada al principio o al final de un contexto largo y rendían peor cuando la evidencia quedaba en el medio.

Qué es la ventana de contexto de una IA y qué entra en ella

La unidad habitual de la ventana es el token, no la palabra ni la página. Un token puede ser una palabra corta, una parte de una palabra, un signo o un fragmento de código. La cantidad producida por un mismo texto cambia según el tokenizador y el idioma; por eso convertir tokens a páginas con una regla fija ofrece apenas una aproximación.

La documentación técnica de Anthropic enumera qué ocupa esa capacidad en una petición: el mensaje de sistema, cada intervención previa, los resultados de herramientas, imágenes, documentos, definiciones de funciones y la salida nueva. También aclara una distinción clave: la ventana incluye la respuesta que todavía falta generar. Si una aplicación llena todo el presupuesto con material de entrada, deja menos espacio para contestar.

El historial se acumula por turnos. La primera pregunta pasa a formar parte de la entrada de la segunda; la respuesta anterior también. En una conversación larga, repetir documentos o conservar resultados de herramientas irrelevantes consume capacidad sin aportar evidencia. Una interfaz puede resolverlo eliminando los primeros turnos, haciendo un resumen o iniciando una sesión limpia, pero esa decisión pertenece a la aplicación: el modelo no adquiere una memoria infinita porque el chat siga abierto.

Más tokens admitidos no garantizan una lectura uniforme

Una cifra grande describe cuánto texto acepta el sistema, no cuánto comprende con la misma precisión. El experimento Lost in the Middle comparó tareas de preguntas sobre varios documentos y recuperación de pares clave-valor. Al cambiar únicamente la posición de la respuesta correcta, el desempeño cayó cuando el dato necesario quedó enterrado en la zona central. El artículo ocupa las páginas 157 a 173 del volumen 12 de TACL y tiene el DOI 10.1162/tacl_a_00638.

Un trabajo posterior presentado en 2026, Too Long, Didn’t Model, sometió siete modelos de frontera a novelas con dependencias narrativas extensas. Sus autores informaron que ninguno mantuvo una comprensión estable más allá de 64.000 tokens en las tareas evaluadas. El resultado no fija un techo universal: muestra que aceptar una entrada larga y seguir relaciones complejas a lo largo de ella son capacidades diferentes.

Esto explica una falla cotidiana. Un contrato, una transcripción y diez anexos pueden caber técnicamente; aun así, una cláusula decisiva puede quedar relegada. Pedir “leé todo” tampoco asegura que cada pasaje reciba el mismo peso. La posición, la repetición, el ruido y la forma de la pregunta modifican qué información termina influyendo en la salida.

Una ventana larga tampoco reemplaza conocimiento ni búsqueda

El contexto dura lo que dura la petición o el historial que la aplicación decida reenviar. El entrenamiento, en cambio, ajustó parámetros antes de la conversación. Pegar un manual reciente permite que el modelo lo consulte en ese turno; no reentrena el sistema ni garantiza que lo recuerde en una sesión futura.

Cuando la colección supera la ventana o cambia con frecuencia, una alternativa consiste en buscar primero los fragmentos pertinentes y pasar sólo esos resultados al modelo. Esa arquitectura se conoce como RAG o generación aumentada por recuperación. Reduce el volumen, aunque introduce otra pregunta: si el buscador trajo el documento correcto y una versión vigente.

La ventana tampoco altera el mecanismo básico de un modelo de lenguaje grande: producir la continuación probable a partir de los tokens disponibles. Más contexto puede aportar pruebas, ejemplos y restricciones; no convierte esa predicción en una base de datos exacta.

Cómo usar la ventana de contexto sin llenarla por costumbre

Para analizar un documento largo conviene entregar una tarea concreta, conservar títulos o numeración y pedir que la respuesta identifique el pasaje usado. Si hay varios archivos, ayuda separar los imprescindibles de los meramente informativos. En conversaciones extensas, un resumen verificado de decisiones y pendientes suele ser más útil que arrastrar decenas de intercambios completos.

También es razonable abrir una sesión nueva cuando cambia el objetivo. Mezclar una corrección de código, una traducción y un informe dentro del mismo historial obliga al modelo a distinguir instrucciones que ya perdieron vigencia. El contexto útil no es el más grande: es el que mantiene evidencia suficiente, jerarquía clara y espacio para responder.

Imagen: Recreación editorial generada con IA de una persona seleccionando fichas en blanco para un espacio de trabajo limitado.

Fuentes

Anthropic: Context windows

Vaswani et al.: Attention Is All You Need

Liu et al.: Lost in the Middle

Hamilton et al.: Too Long, Didn’t Model

Fuente: Anthropic / ACL Anthology

seguir leyendo

Si te interesó, por acá sigue

Rutas para ampliar contexto

Temas relacionados