El susto de las 200 instrucciones
Si mantienes un archivo de skills repleto de reglas del tipo if-X-then-Y, incluye-siempre-Z y nunca-digas-W, la ansiedad operativa no es que el agente se caiga. Es que la salida se vea correcta mientras un subconjunto de esas reglas desaparece en silencio.
Laurie Voss, responsable de relaciones con desarrolladores en Arize AI y cofundador de npm Inc., dedica ahora su tiempo a cómo probar sistemas de IA. En una charla subida al canal de YouTube de AI Engineer el 9 de septiembre de 2026 —la fecha de la sesión del congreso no está en la grabación— sitúa el susto en un número que oyó como un aparte. Unos meses antes, en AI Engineer Miami, Dexter Horthy mencionó de pasada que un agente puede seguir unas 200 instrucciones antes de empezar a olvidar, una cifra de 2025 que, según él, quizá ya hubiera mejorado. La charla no iba de archivos de skills. Voss dejó de escuchar de todos modos, porque 200 no son muchas instrucciones.
Su marco de practicante es que un archivo de skills decente supera las 200 casi de inmediato. Cada regla discreta cuenta por separado: si el usuario dice X, haz Y; incluye siempre una sección sobre Z; nunca uses la frase W. Si el modelo deja de seguir el rastro en silencio después de 200, ese es un techo duro sobre lo que puedes construir. La investigación apunta a la sensación de entregar páginas de tono, formato y casos límite, obtener un resultado plausible y no poder decir si el agente siguió el archivo o devolvió un simulacro cercano.
De dónde salió 200, y por qué las palabras clave son un techo
Voss dice que la cifra 200 no es folklore. La rastrea hasta IFScale, un artículo de benchmark del año anterior de un autor cuyo nombre pronuncia como «Jeroslowitch», más coautores. Radar no recuperó ese artículo, así que aquí no se reconstruye la grafía impresa.
El protocolo, según lo describe, es simple. Pide al modelo que escriba un informe de negocio. Dale una lista creciente de palabras exactas que deben aparecer: customer, revenue, y así. Cada palabra obligatoria es una instrucción. La densidad n es cuántas reglas apilaste; la exactitud es qué proporción de esas palabras exactas apareció.
Las palabras clave obligatorias son un proxy de restricciones nombradas de la misma forma: incluye una sección de precios, o nunca uses esta frase. Voss llama techo a la puntuación resultante. Si un modelo no puede seguir 200 palabras en un prompt, le costará 200 instrucciones más complicadas; las reglas reales más difíciles deberían bajar el número, no subirlo. Sigue siendo una tarea proxy. No es un censo de archivos de skills reales, ni una prueba de si un agente razonó sobre reglas de marca, legales y de herramientas en conflicto.
La replicación de Voss del techo antiguo
Antes de perseguir modelos nuevos, dice, la buena ciencia era volver a ejecutar el conjunto original. Los modelos viven y mueren rápido. De unos diez modelos originales de IFScale, dice que solo GPT-4.1, Claude Sonnet 4 y Gemini 2.5 Pro seguían alcanzables por API en su ventana. Tras publicar la investigación por primera vez, uno de esos tres se retiró después, así que la alineación ya bajaba a dos. La disponibilidad y la retirada quedan como afirmaciones de su ventana de retest; Radar no confirmó un catálogo.
En un gráfico logarítmico de exactitud frente a recuento de reglas, dice que sus curvas coincidieron con el artículo dentro del ruido. Hacia unas 500 reglas, los modelos restantes omitían el 30–50% de las restricciones. Un año antes, los modelos de frontera empezaban a desmoronarse en torno a 200–300 reglas. Esas cifras son el resultado de replicación de Voss. Radar no volvió a ejecutar el benchmark.
Los modelos actuales atravesaron 500, así que movió el muro
Luego apuntó la misma prueba original a lo que entonces era la frontera actual: GPT-5.5, Claude Opus 4.7, Gemini 3.1 Pro y DeepSeek V4 Pro. Probó Opus 4.7 porque, dice, 4.8 salió una semana después. Los cuatro puntuaron 100% de inmediato. El benchmark antiguo se agotaba en 500 palabras, y los modelos atravesaron ese techo sin notar que estaba ahí.
Para hallar un muro nuevo movió las porterías: de 500 a 1,000, luego 2,000, y hasta una lista de 10,000 palabras. En el gráfico logarítmico extendido, dice que las curvas más nuevas aguantan hasta unas 2,000 restricciones nombradas, y las mejores hasta unas 5,000: cerca de 10x de seguimiento simultáneo de instrucciones en unos doce meses. Esas son sus cifras destacadas de esta corrida extendida al estilo IFScale, no hechos comprobados por Radar.
La sensación cotidiana y la métrica pueden disentir. Dice que el salto de GPT-5.1 a GPT-5.5 se sintió incremental, pero esta puntuación se movió mucho. También dice que Opus 4.8 ya dejó el gráfico un poco caduco, así que las hipótesis de longitud de skills y prompts de más de unos seis meses deberían rediseñarse. Es un consejo fechado de esta charla, no una ley de calendario para cada pila.
Cuatro modos de fallo en lugar del olvido silencioso
El resultado inesperado fue que los modelos nuevos ya no fallan sobre todo soltando reglas en silencio. Cada uno de los cuatro falló de un modo distintivo que rompió la historia original de puntuación.
DeepSeek 4, en su corrida, es el caso tradicional: empieza a olvidar en torno a 750 reglas y hacia 2,000 deja caer casi la mitad. Confía en ese patrón porque es medible. Es su curva de DeepSeek, no una clasificación de producto.
Opus 4.7 trató las combinaciones de palabras aleatorias como peligrosas y se negó en la API. Un clasificador de seguridad, dice, se retiraba si palabras como anthrax y cyanide caían en el mismo prompt. Tras filtrar el vocabulario con un filtro de seguridad de OpenAI, Claude rindió bien, pero dice que puede negarse tan pronto como 200–300 instrucciones en contenido médico o de doble uso. Es su conducta observada en este prompt de palabras aleatorias, no una evaluación general de seguridad.
Gemini 3.1 Pro se mantuvo fuerte hasta 5,000, luego gastó su presupuesto de tokens de pensamiento intentando satisfacer cada regla y devolvió una respuesta corta sin las palabras obligatorias. En una anécdota de la misma corrida, un presupuesto de 10,000 tokens se convirtió en unos 9,500 tokens de pensamiento y una respuesta de 500 palabras sin ninguno de los términos exigidos.
GPT-5.5 fue el más fuerte en el gráfico, con unos 99% de exactitud hasta 5,000 reglas. Empujado más lejos, empezó el informe y luego abandonó la tarea como una petición estúpida: una media respuesta pulida que igual cuenta como fallo y es difícil de notar si no lees hasta el final.
Su taxonomía: DeepSeek olvida en silencio, Claude se niega, Gemini piensa de más hasta el silencio, y GPT-5.5 termina parte del trabajo y declina el resto. El seguimiento de instrucciones ya no tiene un solo modo de fallo reconocible.
| Modelo en la corrida de Voss | Cómo falló | Dónde se rompió la curva |
|---|---|---|
| DeepSeek 4 | Soltó en silencio las palabras obligatorias | Olvido desde unas 750 reglas; casi la mitad ausente hacia 2,000 |
| Claude Opus 4.7 | El clasificador de seguridad se negó en la API | Las combinaciones de palabras aleatorias parecieron peligrosas; también vio negativas tan pronto como 200–300 en contenido médico o de doble uso |
| Gemini 3.1 Pro | Gastó el presupuesto de pensamiento y luego devolvió una respuesta corta | Aguantó hasta unas 5,000 y luego pensó de más hasta una respuesta sin las palabras obligatorias |
| GPT-5.5 | Empezó un informe pulido y luego se bajó por petición estúpida | Unos 99% de exactitud hasta 5,000 reglas; la respuesta a medias es fácil de pasar por alto |
Qué cambia eso en un flujo de skills
Hace un año, dice, el movimiento inteligente era mantener los skills por debajo de unas 200 instrucciones y trocear el resto en un laberinto de subskills. Ahora dice que esa compresión ya no hace falta y que los archivos de skills pueden ser mucho más largos. Si un caso de uso necesita 100 o 300 reglas concretas, pueden vivir en un prompt sin la ansiedad antigua de que el modelo ignorara un subconjunto en silencio.
Dos mil restricciones nombradas, en su ilustración, son una guía de estilo entera de reglas de marca y legales que hace un año se habrían troceado entre agentes especializados. Es una analogía, no un experimento medido de guía de marca.
La pregunta antigua era si el modelo podía sostener las reglas. La nueva es si meter miles de instrucciones vale un prompt más grande, más lento y más caro. El muro duro se volvió un intercambio entre coste y latencia. No ofrece una lista pública de precios; el coste sigue cualitativo.
- Los archivos de skills ya no tienen que quedarse bajo unas 200 instrucciones con un laberinto de subskills.
- Unos cientos de reglas concretas pueden vivir en un prompt, a su juicio, sin la ansiedad antigua de la caída silenciosa.
- La restricción vinculante ahora es el coste y la latencia, no un muro duro de capacidad.
Lo que la prueba de palabras clave no demuestra
Meter palabras aleatorias en un informe falso es evidencia de que los skills largos podrían funcionar, no prueba de que lo hagan. Los modelos de su conjunto chocaron con el muro en cualquier punto entre unas 750 y más de 9,000 reglas, así que la elección de modelo sigue importando.
La prueba no mide un razonamiento claro sobre un prompt gigante, ni la resolución de conflictos entre reglas. Seguir 2,000, 5,000 o posiblemente 10,000 instrucciones no es lo mismo que razonar sobre ellas.
Cita trabajo posterior de context-rot de Chroma, según lo resumió: en 18 modelos, la exactitud con entradas largas puede caer 30–50% mucho antes del límite de la ventana de contexto, y el texto estructurado coherente es más vulnerable que las instrucciones barajadas. Dijo que no había leído el informe por completo. Radar no tiene el cuerpo del artículo, así que esas cifras quedan como el recuento de Voss.
Un artículo posterior que cita, al probar 46 modelos al revisar la fiabilidad de los modelos de lenguaje en el seguimiento de instrucciones, halló que un modelo puede sobresalir en un benchmark de estilo palabras clave y aun así colapsar si las mismas instrucciones se reformulan o se reordenan. La capacidad subió; la fiabilidad sigue siendo un problema. Nombra Firebench, CCR Bench y Guidebench como intentos más nuevos de medir el seguimiento real y desordenado de restricciones. Son trabajos emergentes relacionados que mencionó, no reseñas de Radar.
Lo difícil ahora es la verificación
Las negativas de Claude son errores ruidosos de API. El informe educado a medias de GPT parece una respuesta real si no lees hasta el final. El fallo silencioso es el peligroso.
Como los modelos de frontera pueden fallar en silencio en tareas de producción difíciles, sostiene que hace falta monitorizar la salida: otro modelo que compruebe el resultado, lo que llama un eval. Es consejo de monitorización de esta charla, no una clasificación de producto. Como aparte de coste del experimento, dijo que el conjunto completo de consultas le costó $29 por unas 2,300 llamadas en siete modelos; no es una lista pública de precios de API.
Su cierre: hace un año escribir un skill era un problema de compresión, encajar reglas sin perder el hilo. Ese techo se movió unos 10x en su métrica. Lo difícil ahora es verificar que el modelo hizo de verdad lo que se le dijo, algo que un prompt mejor no resuelve. Revisa las hipótesis de tamaño de prompt e instrucciones de hace seis meses porque quizá ya estén equivocadas. Señaló una URL de GitHub en pantalla para código y datos; los subtítulos no pronuncian la URL.
Fuente
También de
Fuentes y criterio editorial
Subtítulos en inglés completos de la subida a YouTube de AI Engineer (grabación completa, recuperada el 2026-09-13). No se predescargaron cuerpos oficiales de IFScale, Chroma ni del artículo de fiabilidad. Las afirmaciones de rendimiento, disponibilidad, retirada y coste del experimento siguen atribuidas a Voss.