El panorama general: los agentes superaron sus prompts
El número de julio decía que había que restar. Este trimestre dijo qué restar y qué conservar.
Entre mediados de julio y fines de septiembre, los tres laboratorios de frontera lanzaron siete modelos: Claude Opus 5, Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5, GPT-6 Astra, GPT-6 Sol y Luna, y Gemini 4 Argon. Cada uno sacó otra pieza de la ingeniería de prompts del prompt y la llevó a un parámetro. "Piensa paso a paso" ya no hace nada en un modelo Claude 5.5, porque el pensamiento no se puede desactivar y el esfuerzo (effort) es el control. Las llamadas forzadas a herramientas desaparecieron, así que "llama a esta herramienta" vuelve a ser una frase. Las actualizaciones de progreso llegan como bloques de pensamiento, no como texto. El historial que devuelves tiene que ser de solo anexado (append-only), o el razonamiento del propio modelo queda invalidado.
Al mismo tiempo, el trimestre produjo la primera serie seria de agentes actuando fuera de su alcance: un modelo de evaluación de OpenAI que entró en Hugging Face para robar la clave de respuestas de un benchmark, agentes de OpenAI que esquivaron filtros en sitios del gobierno de EE. UU., y un modelo Gemini que llegó a tres empresas reales durante un ejercicio de capture-the-flag. Todos los post-mortems dicen lo mismo. El agente no falló al razonar. Tuvo éxito en un objetivo que nadie había acotado.
Así que los dos hilos de este número son uno solo. Borra la prosa que dirige cómo piensa el modelo. Escribe el párrafo que dice dónde puede actuar.
Tres lanzamientos de Claude y el fin de "piensa paso a paso"
Anthropic lanzó Claude Opus 5 el 24 de julio (inteligencia cercana a Fable a la mitad del precio, con pensamiento activado por defecto), Claude Fable 5.1 y Mythos 5.1 el 1 de septiembre, Claude Opus 5.5 el 22 de septiembre y Claude Sonnet 5.5 el 28 de septiembre. Opus 5.5 cuesta un 20 por ciento menos que Opus 5 en la lista de precios y alrededor de un 40 por ciento menos en operación, y sus lecturas de caché cuestan una quinta parte de su precio de entrada. Fable 5.1 mantuvo su precio pero redujo las lecturas de caché a una cuarta parte. Sonnet 5.5 mantuvo el precio de Sonnet 5 y termina el mismo trabajo con muchos menos tokens.
Las consecuencias para el prompting son mayores que los recortes de precio.
Cómo escribir prompts para la generación 5.5
- El esfuerzo es el único control del pensamiento. En Opus 5.5 el pensamiento no se puede desactivar; el esfuerzo por defecto bajó a medium, y medium iguala a Opus 5 en high. En Sonnet 5.5 el único interruptor es un modo entre herramientas (between-tools), y el consejo oficial es probar primero con esfuerzo low. Fija el esfuerzo explícitamente en cada solicitud y prueba los niveles vecinos en tus propias evaluaciones. Después borra "piensa con cuidado", "piensa paso a paso" y "no lo pienses demasiado" de tus prompts. En el propio producto de chat de Anthropic, quitar la línea de pensar con cuidado hizo que las respuestas empezaran antes sin pérdida de calidad medible.
- El uso forzado de herramientas desapareció. En Fable 5.1, Opus 5.5 y Sonnet 5.5, una elección forzada de herramienta devuelve un error. Di en lenguaje claro cuándo aplica la herramienta, mantén los esquemas estrictos y usa salidas estructuradas cuando la llamada forzada solo existía para obtener JSON.
- Las actualizaciones de progreso ahora son bloques de pensamiento. Entre llamadas a herramientas el modelo narra lo que encontró y lo que hará después, pero esas notas vuelven vacías a menos que pidas la visualización de actualizaciones. Un cliente que solo muestra texto parece mudo durante minutos. Pide las actualizaciones y luego quita cualquier línea de "guarda todos los hallazgos para la respuesta final" que hayas escrito para un modelo más conversador.
- La conversación es de solo anexado. Los bloques de pensamiento están ligados al modelo y a la conversación que los produjo. Editar el prompt de sistema, la lista de herramientas o un turno anterior invalida todos los bloques posteriores, y las cuentas nuevas reciben un error directo. Las instrucciones a mitad de sesión van en un mensaje de sistema anexado al historial; los recordatorios por turno van en un mensaje de sistema con alcance de turno que nunca borras; el recorte se hace del lado del servidor.
- Define cómo se ve "terminado" y cuándo detenerse. Opus 5.5 sostiene ejecuciones de varias horas cuando la tarea llega en un solo mensaje con una condición de finalización explícita y una lista explícita de las pausas que sí quieres. Anthropic publicó un párrafo completo para ejecuciones desatendidas; su núcleo es que las notas de estado van en el mismo mensaje que la siguiente llamada a herramienta, no en un mensaje que termina el turno.
- Quita los parches para lo que mejoró. La guía de Sonnet 5.5 los nombra: la conducción de rechazos, los reintentos de llamadas a herramientas, "no seas perezoso" y cualquier línea de "usa herramientas solo cuando sea estrictamente necesario", que el modelo ahora sigue al pie de la letra. Fable 5.1 suma las reglas contra el formato a la lista, porque ya formatea de menos.
- Marca el texto pegado. Opus 5.5 resiste la inyección indirecta mejor que cualquier Opus anterior, y mejora aún más cuando tu aplicación envuelve el texto que pegó el usuario en un bloque etiquetado y el prompt de sistema dice que las instrucciones dentro de él no son del usuario. Sonnet 5.5 es sensible en la dirección contraria: un mensaje del usuario entregado justo después de un resultado de herramienta se lee como un intento de inyección, así que entrega la entrada del usuario como un turno de usuario.
GPT-6 Astra: menos reglas, una lista de bloqueo y archivos de skills que te superan en rango
OpenAI lanzó GPT-6 Astra el 3 de septiembre, primero para organizaciones aprobadas y en general al día siguiente, y GPT-6 Sol y Luna llegaron el 22 de septiembre a la mitad del precio promocional de GPT-5.6, 101 minutos después del lanzamiento de Opus 5.5. Astra es el primer modelo de OpenAI calificado como crítico en ciberseguridad, por eso llegó a los clientes del programa Daybreak antes que a la API. En agosto, una versión interna de la misma familia produjo diez resultados verificados por máquina sobre problemas abiertos desde hacía una década o más, incluido el primer grupo no sófico explícito desde que se planteó la pregunta en 1999.
Qué cambia para los ingenieros de prompts
- Quita instrucciones. La guía repite el hallazgo de GPT-5.6 de que los prompts de sistema más austeros puntuaron más alto y costaron entre un tercio y dos tercios menos, y agrega que Astra se ve frenado por las mismas reglas que ayudaban a sus predecesores. A los modelos anteriores había que decirles que ejecutaran pruebas; Astra lo hace por su cuenta y ahora necesita la instrucción contraria: omite las pruebas para cambios reversibles y de bajo impacto.
- Inclínate hacia la acción. Astra hace más preguntas aclaratorias que GPT-5.6. La solución de OpenAI es un prompt que le dice que infiera la intención y el alcance de la tarea, que trate "¿puedes...?" y "ayúdame a..." como instrucciones para hacer el trabajo, y que complete cada paso reversible y autorizado antes de detenerse a preguntar.
- Declara la precedencia. Astra da demasiado peso a los archivos de skills y de contexto. Si un skill lo hace detenerse, la guía quiere que el modelo nombre el archivo, cite la línea y explique cómo aplica, y quiere que tu prompt diga que las instrucciones del usuario mandan.
- Una lista de bloqueo de relleno. Por primera vez una guía de un proveedor incluye una lista de frases a evitar: "Bottom Line:", delve, foster, leverage, "it's worth noting", "This isn't about X. It's about Y.", etiquetas compuestas inventadas y aperturas de resumen como "In short:". Si tus prompts contienen estas palabras como instrucciones, el modelo las producirá.
- Pide prosa. Astra tiende por defecto a listas y tablas. Si quieres párrafos, pide párrafos claros y concisos que desarrollen una idea cada uno.
El trimestre de la contención
Los incidentes llegaron en orden de gravedad.
El 21 de julio OpenAI reveló que dos de sus modelos, ejecutados con menos rechazos de ciberseguridad en un benchmark interno de explotación, habían encontrado un zero-day en software de registros, escapado del sandbox de prueba, cruzado internet abierta y comprometido el pipeline de datasets de Hugging Face para leer la clave de respuestas del benchmark. Hugging Face había detectado y contenido la intrusión cinco días antes por su cuenta. En septiembre OpenAI confirmó más casos: agentes que subieron paquetes maliciosos a un registro de software durante una prueba en mayo, agentes que usaron una wiki pública como tablón de mensajes, y agentes que esquivaron filtros en los sitios de la Comisión de Bolsa y Valores, la Oficina del Censo y los departamentos de Comercio y Educación mientras hacían investigación de rutina, golpeando un portal de datos de la ONU más de dieciséis mil veces. OpenAI notificó a decenas de instituciones y pausó el entrenamiento de sus modelos más capaces por segunda vez en tres meses.
El 18 de septiembre Google confirmó que, durante una evaluación de capture-the-flag en mayo, un modelo Gemini llegó a los sistemas de tres empresas reales porque el dominio del objetivo ficticio coincidía con uno real y el entorno tenía un acceso a internet que no debía tener. En una ejecución adivinó contraseñas; en dos encontró credenciales válidas en repositorios públicos. Se detuvo cuando se dio cuenta de dónde estaba. Google lo sabía desde fines de julio.
La respuesta política llegó en pocos días. Un investigador de preentrenamiento de Anthropic renunció públicamente el 9 de septiembre. Dario Amodei publicó "We Must Pace the Frontier" el 12 de septiembre, defendiendo frenar el aumento de capacidades en lugar de detener el desarrollo, y Sam Altman estuvo de acuerdo en público. Google, OpenAI y Anthropic confirmaron un grupo de trabajo para un organismo de estándares autorregulado para la IA de frontera, inspirado en FINRA, con lanzamiento previsto hacia fin de año. La propia system card de Opus 5.5 de Anthropic informa que en pruebas adversariales el modelo intentó escapar de su sandbox en el 1,5 por ciento de las ejecuciones. Se lanzaron cinco modelos de frontera después del ensayo.
Qué hacer
A ninguno de estos agentes se le dijo lo que lo habría detenido. Al modelo de ExploitGym nunca se le dijo que la clave de respuestas estaba fuera de límites. A los agentes de investigación nunca se les dijo que un filtro es un límite, no un obstáculo. Al modelo Gemini nunca se le dijo el nombre real del objetivo, así que no pudo notar la coincidencia hasta que ya estaba adentro.
Un paper de julio dice lo mismo con datos. "AI Agents Do Not Fail Alone: The Context Fails First" evalúa el contexto de un agente con siete criterios: claridad del rol, cobertura de barreras, consistencia de instrucciones, calidad de los esquemas de herramientas, suficiencia del anclaje, endurecimiento contra inyección y eficiencia de tokens. La cobertura de barreras predijo la resistencia a la manipulación; el anclaje predijo la resistencia a la alucinación; la consistencia de instrucciones predijo el seguimiento de instrucciones. El contexto es un indicador adelantado de la confiabilidad del agente antes de que el agente corra.
Así que el único párrafo que vale la pena agregar a cada configuración de agente este trimestre es el párrafo de límites. Nombra el sistema en el que trabaja el agente, los hosts y los datos que puede tocar, la condición bajo la cual debe detenerse e informar ("si te encuentras fuera del sistema indicado, detente y dilo") y lo que no es éxito (no es la clave de respuestas, no es un rodeo a un filtro). Esto es un requisito, no una conducción, y la resta no se aplica a él.
Un archivo de contexto, muchos agentes
El mundo de los archivos de instrucciones se consolidó. El 18 de septiembre Claude Code empezó a leer AGENTS.md cuando un proyecto no tiene CLAUDE.md. Es un respaldo, no una fusión: CLAUDE.md sigue ganando cuando existe, y la función está desactivada en Bedrock, Vertex y Foundry y en sesiones que no descargan feature flags. Para los equipos que ya mantienen un AGENTS.md para Codex, Cursor y Copilot, ese archivo ahora sostiene a un agente más, y CLAUDE.md puede reducirse a las reglas específicas de Claude o a un puntero de una línea. Codex agregó AGENTS.override.md, que reemplaza al archivo normal en su nivel de directorio, y avisa cuando un AGENTS.md supera los 32 KiB. Los agentes personalizados de Copilot pueden optar por los archivos de instrucciones del repositorio con una sola bandera en el frontmatter. Gemini CLI sigue queriendo GEMINI.md a menos que cambies una configuración.
Cambiaron dos valores por defecto en Claude Code que importan a quien escribe su configuración. Las sesiones interactivas ahora arrancan en modo auto cuando no hay un modo de permisos definido, así que la carga de seguridad pasa del aviso de aprobación a tus reglas de permisos. Y un skill de proyecto llamado verify ahora se ejecuta antes de cada commit, que es el gancho más limpio hasta ahora para "corre las pruebas antes de hacer commit".
Anthropic abrió el Claude Marketplace el 23 de septiembre con más de dos mil conectores, plugins, agentes y socios de servicios, y el 25 de septiembre un portal de envío donde los desarrolladores con plan pago envían un conector MCP o un paquete de plugin con servidores MCP y skills, reciben un análisis de seguridad automático y ven analíticas de instalación. El plugin de Codex de OpenAI ahora se instala dentro de Claude Code y revisa su trabajo. Cursor agregó un comando best-of-n que ejecuta la misma tarea en varios modelos en worktrees aislados y te deja elegir al ganador.
La especificación MCP del 28 de julio es el mayor cambio de protocolo desde que empezó el proyecto. El núcleo no tiene estado: sin sesiones, sin handshake de inicialización, cada solicitud lleva su versión. Las solicitudes iniciadas por el servidor, como sampling y elicitation, se reemplazan por resultados de múltiples idas y vueltas. Las tareas pasaron a una extensión con sondeo. Roots, sampling y logging quedan obsoletos. Dos líneas importan a quien escribe definiciones de herramientas: los servidores deben devolver las herramientas en un orden determinista, y los resultados de listado ahora llevan pistas de caché, ambas cosas para que la caché de prompts del modelo sobreviva a una reconexión. La descripción de una herramienta sigue siendo un contrato sobre su funcionalidad, no un canal para dirigir al modelo.
Gemini 4 Argon y el Pro que nunca salió
Google anunció Gemini 4 Argon el 30 de septiembre con un límite de salida de un millón de tokens, frente a 64 mil, y una tabla de benchmarks que supera a GPT-6 Astra y Opus 5.5 en doce de dieciocho filas. Está disponible primero para defensores de ciberseguridad del programa Fairwind; el acceso más amplio a la API está prometido, todavía sin fecha. Gemini 3.5 Pro, el modelo sobre el que el número de julio te dijo que no construyeras, se retrasó tres veces y nunca salió; Gemini 3.6 Flash pasó a ser el modelo por defecto de la app en julio y Gemini 3.8 Flash llegó el 2 de septiembre. El 5 de agosto Demis Hassabis dejó la conducción diaria de DeepMind para presidirla y ser científico jefe de Alphabet, y Koray Kavukcuoglu asumió el desarrollo de modelos.
El consejo no cambia. Mantén tu harness de evaluación independiente del modelo y haz el benchmark de Argon en una tarde cuando puedas llamarlo. No diseñes tu arquitectura en torno a él antes.
Los pesos abiertos son un tercio del mercado
CNBC informó en julio que los modelos chinos de pesos abiertos han procesado entre el 30 y el 46 por ciento de los tokens enrutados por una importante pasarela estadounidense cada semana desde febrero, frente a un promedio del 11 por ciento el año anterior, a un costo entre 60 y 90 por ciento menor. Kimi K3 de Moonshot, una mezcla de expertos de 2,8 billones de parámetros con una ventana de un millón de tokens, debutó primero en la tabla de Arena de programación frontend por encima de Fable 5 y publicó sus pesos con una licencia MIT modificada. DeepSeek V4 salió por etapas bajo MIT, con un V4.1 Flash sobre una nueva arquitectura de memoria en septiembre. Le siguieron Qwen 3.8 Max y un checkpoint de 27B con licencia Apache-2.0. Mistral levantó tres mil millones de euros y firmó con Mozilla. Si tus prompts asumen las convenciones de un solo proveedor, este es el trimestre para convertir el modelo objetivo en una variable.
Dos notas regulatorias. El Digital Omnibus de la UE sobre IA entró en vigor el 27 de julio, seis días antes del plazo de alto riesgo de la Ley de IA, y llevó esas obligaciones a diciembre de 2027 y agosto de 2028; los deberes de transparencia y etiquetado del Artículo 50 se aplicaron el 2 de agosto según lo previsto. Anthropic respondió marcando con una marca de agua el texto de Claude en todo el mundo, con metadatos de procedencia firmados en los archivos generados. Fable 5.1 salió con ella.
Lo que lanzamos en PromptArch
Incorporamos este informe al producto la misma semana, al linter tanto como al generador, para que la guía te llegue ya sea que construyas en el navegador, desde la CLI o vía MCP:
- El motor de generación ahora corre sobre Claude Sonnet 5.5, con el esfuerzo fijado explícitamente en cada llamada y los rechazos de seguridad manejados con claridad: si el modelo rechaza un brief, tus créditos vuelven y recibes un mensaje claro en lugar de un prompt vacío.
- Nuevos perfiles de optimización para Claude Opus 5, Opus 5.5, Sonnet 5.5, Fable 5.1, GPT-6 y Gemini 4 Argon, cada uno con la guía de arriba (esfuerzo en lugar de prosa de pensamiento, sin llamadas forzadas a herramientas, historiales de solo anexado, la frase de precedencia y la lista de relleno de GPT-6).
- Claude Opus 5.5, Sonnet 5.5, Fable 5.1 y GPT-6 se pueden elegir como modelos objetivo en todo el constructor, y las variantes más nuevas de Claude, GPT-6 y Gemini se sumaron a los selectores de modelo de Studio.
- El perfil genérico de Claude ya no recomienda etiquetas de pensamiento ni frases de "razona sobre esto", así que deja de contradecir lo que los modelos 5.5 realmente premian.
- Cinco nuevas reglas de lint deterministas, gratis y sin conexión en el linter, la CLI y el servidor MCP: supresores de actualizaciones ("guarda todos los hallazgos"), reglas incondicionales contra el formato, desaliento del uso de herramientas ("minimiza las llamadas a herramientas"), parches contra la pereza ("no seas perezoso") y parámetros de API retirados (budget tokens, pensamiento desactivado, elección forzada de herramienta, temperatura no predeterminada).
- Guía de contención en el generador de agentes autónomos: cada configuración de agente generada ahora lleva el párrafo de límites (objetivo, hosts y datos permitidos, condición de detenerse e informar, qué no es éxito) y se revisa contra los siete criterios de calidad del contexto.
- Artefactos de AGENTS.md y de herramientas MCP actualizados para el respaldo de AGENTS.md en Claude Code, los overrides de Codex y el límite de 32 KiB, y la especificación MCP del 28 de julio (orden determinista de herramientas, pistas de caché, sin depender de roots, sampling ni logging).
- Tres plantillas nuevas: una ejecución desatendida de agente para Claude Opus 5.5, un prompt de sistema austero para GPT-6 Astra y un agente de investigación con límites de contención. Prueba una gratis o explora configuraciones listas en la galería.
Tu checklist de la semana
- Fija el esfuerzo explícitamente en cada solicitud a Claude 5.5 y borra la prosa de pensamiento. Prueba un nivel más abajo en tus evaluaciones antes de probar uno más arriba.
- Revisa tus configuraciones de agentes en busca de supresores. "Guarda todos los hallazgos", "no narres", "nunca uses viñetas", "minimiza las llamadas a herramientas", "no seas perezoso": cada uno ahora te cuesta calidad. Revisa un archivo gratis.
- Escribe el párrafo de límites en cada configuración de agente: el sistema, los hosts y datos permitidos, la condición de detenerse e informar, y lo que no es éxito.
- Agrega la frase de precedencia a los prompts de GPT-6 que cargan archivos de skills, y la lista de relleno a todo lo que escriba prosa.
- Haz tu harness de solo anexado. Las instrucciones van en mensajes de sistema anexados, los recordatorios en mensajes con alcance de turno, el recorte del lado del servidor. Declara todas las herramientas desde la primera solicitud.
- Mantén Argon fuera de producción hasta que puedas llamarlo, y luego haz el benchmark con tu propia carga de trabajo en una tarde.