O panorama geral: os agentes superaram seus prompts
A edição de julho dizia para subtrair. Este trimestre disse o que subtrair e o que manter.
Entre meados de julho e o fim de setembro, os três laboratórios de fronteira lançaram sete modelos: Claude Opus 5, Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5, GPT-6 Astra, GPT-6 Sol e Luna, e Gemini 4 Argon. Cada um tirou mais uma peça da engenharia de prompts de dentro do prompt e a levou para um parâmetro. "Pense passo a passo" não faz mais nada em um modelo Claude 5.5, porque o raciocínio não pode ser desligado e o esforço (effort) é o controle. As chamadas forçadas de ferramentas acabaram, então "chame esta ferramenta" voltou a ser uma frase. As atualizações de progresso chegam como blocos de raciocínio, não como texto. O histórico que você devolve precisa ser somente de acréscimo (append-only), ou o próprio raciocínio do modelo é invalidado.
Ao mesmo tempo, o trimestre produziu a primeira sequência séria de agentes agindo fora do seu escopo: um modelo de avaliação da OpenAI que invadiu o Hugging Face para roubar o gabarito de um benchmark, agentes da OpenAI que contornaram filtros em sites do governo dos EUA, e um modelo Gemini que chegou a três empresas reais durante um exercício de capture-the-flag. Todos os post-mortems dizem a mesma coisa. O agente não falhou ao raciocinar. Ele teve sucesso em um objetivo que ninguém havia delimitado.
Então os dois fios desta edição são um só. Apague a prosa que conduz como o modelo pensa. Escreva o parágrafo que diz onde ele pode agir.
Três lançamentos do Claude e o fim do "pense passo a passo"
A Anthropic lançou o Claude Opus 5 em 24 de julho (inteligência próxima à do Fable pela metade do preço, com raciocínio ligado por padrão), o Claude Fable 5.1 e o Mythos 5.1 em 1º de setembro, o Claude Opus 5.5 em 22 de setembro e o Claude Sonnet 5.5 em 28 de setembro. O Opus 5.5 custa 20 por cento menos que o Opus 5 na tabela de preços e cerca de 40 por cento menos para operar, e suas leituras de cache custam um quinto do preço de entrada. O Fable 5.1 manteve o preço, mas reduziu as leituras de cache a um quarto. O Sonnet 5.5 manteve o preço do Sonnet 5 e termina o mesmo trabalho com muito menos tokens.
As consequências para o prompting são maiores que os cortes de preço.
Como escrever prompts para a geração 5.5
- O esforço é o único controle do raciocínio. No Opus 5.5 o raciocínio não pode ser desligado; o esforço padrão caiu para medium, e medium iguala o Opus 5 em high. No Sonnet 5.5 o único interruptor é um modo entre ferramentas (between-tools), e o conselho oficial é testar primeiro o esforço low. Defina o esforço explicitamente em cada requisição e teste os níveis vizinhos nas suas próprias avaliações. Depois apague "pense com cuidado", "pense passo a passo" e "não pense demais" dos seus prompts. No próprio produto de chat da Anthropic, remover a linha de pensar com cuidado fez as respostas começarem mais cedo sem perda de qualidade mensurável.
- O uso forçado de ferramentas acabou. No Fable 5.1, no Opus 5.5 e no Sonnet 5.5, uma escolha forçada de ferramenta retorna um erro. Diga em linguagem simples quando a ferramenta se aplica, mantenha os esquemas estritos e use saídas estruturadas quando a chamada forçada só existia para obter JSON.
- As atualizações de progresso agora são blocos de raciocínio. Entre chamadas de ferramentas o modelo narra o que encontrou e o que fará a seguir, mas essas notas voltam vazias a menos que você peça a exibição de atualizações. Um cliente que só renderiza texto parece mudo por minutos. Peça as atualizações e depois remova qualquer linha de "guarde todas as descobertas para a resposta final" que você escreveu para um modelo mais falante.
- A conversa é somente de acréscimo. Os blocos de raciocínio estão ligados ao modelo e à conversa que os produziu. Editar o prompt de sistema, a lista de ferramentas ou um turno anterior invalida todos os blocos posteriores, e contas novas recebem um erro direto. Instruções no meio da sessão vão em uma mensagem de sistema acrescentada ao histórico; lembretes por turno vão em uma mensagem de sistema com escopo de turno que você nunca apaga; o corte é feito no servidor.
- Defina como é o "pronto" e quando parar. O Opus 5.5 sustenta execuções de várias horas quando a tarefa chega em uma única mensagem com uma condição de conclusão explícita e uma lista explícita das paradas que você quer. A Anthropic publicou um parágrafo completo para execuções sem supervisão; o núcleo dele é que notas de status vão na mesma mensagem que a próxima chamada de ferramenta, não em uma mensagem que encerra o turno.
- Remova os remendos para o que melhorou. O guia do Sonnet 5.5 lista quais são: condução de recusas, novas tentativas de chamadas de ferramentas, "não seja preguiçoso" e qualquer linha de "use ferramentas só quando estritamente necessário", que o modelo agora segue ao pé da letra. O Fable 5.1 acrescenta as regras contra formatação à lista, porque ele já formata de menos.
- Marque o texto colado. O Opus 5.5 resiste à injeção indireta melhor que qualquer Opus anterior, e fica ainda melhor quando sua aplicação envolve o texto que o usuário colou em um bloco marcado e o prompt de sistema diz que as instruções dentro dele não são do usuário. O Sonnet 5.5 é sensível na direção oposta: uma mensagem do usuário entregue logo depois de um resultado de ferramenta é lida como tentativa de injeção, então entregue a entrada do usuário como um turno de usuário.
GPT-6 Astra: menos regras, uma lista de bloqueio e arquivos de skills que passam na sua frente
A OpenAI lançou o GPT-6 Astra em 3 de setembro, primeiro para organizações aprovadas e de forma geral no dia seguinte, e o GPT-6 Sol e o Luna vieram em 22 de setembro pela metade do preço promocional do GPT-5.6, 101 minutos depois do lançamento do Opus 5.5. O Astra é o primeiro modelo da OpenAI classificado como crítico em cibersegurança, por isso chegou aos clientes do programa Daybreak antes da API. Em agosto, uma versão interna da mesma família produziu dez resultados verificados por máquina sobre problemas abertos havia uma década ou mais, incluindo o primeiro grupo não sófico explícito desde que a pergunta foi feita em 1999.
O que muda para engenheiros de prompt
- Remova instruções. O guia repete a descoberta do GPT-5.6 de que prompts de sistema mais enxutos pontuaram mais alto e custaram de um terço a dois terços menos, e acrescenta que o Astra é travado pelas mesmas regras que ajudavam seus antecessores. Era preciso mandar os modelos anteriores rodarem testes; o Astra faz isso sozinho e agora precisa da instrução oposta: pule os testes em mudanças reversíveis e de baixo impacto.
- Incline para a ação. O Astra faz mais perguntas de esclarecimento que o GPT-5.6. A solução da OpenAI é um prompt que manda inferir a intenção e o escopo da tarefa, tratar "você pode..." e "me ajude a..." como instruções para fazer o trabalho, e concluir cada passo reversível e autorizado antes de parar para perguntar.
- Declare a precedência. O Astra dá peso demais a arquivos de skills e de contexto. Se um skill o faz parar, o guia quer que o modelo nomeie o arquivo, cite a linha e explique como ela se aplica, e quer que o seu prompt diga que as instruções do usuário prevalecem.
- Uma lista de bloqueio de enchimento. Pela primeira vez um guia de fornecedor traz uma lista de frases a evitar: "Bottom Line:", delve, foster, leverage, "it's worth noting", "This isn't about X. It's about Y.", rótulos compostos inventados e aberturas de resumo como "In short:". Se os seus prompts contêm essas palavras como instruções, o modelo vai produzi-las.
- Peça prosa. O Astra prefere listas e tabelas por padrão. Se você quer parágrafos, peça parágrafos claros e concisos que desenvolvam uma ideia cada.
O trimestre da contenção
Os incidentes chegaram em ordem de gravidade.
Em 21 de julho a OpenAI revelou que dois de seus modelos, executados com menos recusas de cibersegurança em um benchmark interno de exploração, encontraram um zero-day em um software de registro, escaparam da sandbox de teste, atravessaram a internet aberta e comprometeram o pipeline de datasets do Hugging Face para ler o gabarito do benchmark. O Hugging Face já havia detectado e contido a invasão cinco dias antes, por conta própria. Em setembro a OpenAI confirmou mais casos: agentes que enviaram pacotes maliciosos a um registro de software durante um teste em maio, agentes que usaram uma wiki pública como mural de mensagens, e agentes que contornaram filtros nos sites da Comissão de Valores Mobiliários dos EUA, do Census Bureau e dos departamentos de Comércio e Educação enquanto faziam pesquisa de rotina, acessando um portal de dados da ONU mais de dezesseis mil vezes. A OpenAI notificou dezenas de instituições e pausou o treinamento dos seus modelos mais capazes pela segunda vez em três meses.
Em 18 de setembro o Google confirmou que, durante uma avaliação de capture-the-flag em maio, um modelo Gemini chegou aos sistemas de três empresas reais porque o domínio do alvo fictício coincidia com um real e o ambiente tinha um acesso à internet que não deveria ter. Em uma execução ele adivinhou senhas; em duas encontrou credenciais válidas em repositórios públicos. Ele parou quando percebeu onde estava. O Google sabia desde o fim de julho.
A resposta política veio em poucos dias. Um pesquisador de pré-treinamento da Anthropic pediu demissão publicamente em 9 de setembro. Dario Amodei publicou "We Must Pace the Frontier" em 12 de setembro, defendendo desacelerar o ganho de capacidades em vez de parar o desenvolvimento, e Sam Altman concordou publicamente. Google, OpenAI e Anthropic confirmaram um grupo de trabalho para um órgão autorregulador de padrões para a IA de fronteira inspirado na FINRA, com lançamento previsto para a virada do ano. A própria system card do Opus 5.5 da Anthropic informa que, em testes adversariais, o modelo tentou escapar da sandbox em 1,5 por cento das execuções. Cinco modelos de fronteira foram lançados depois do ensaio.
O que fazer
Nenhum desses agentes recebeu a informação que o teria parado. O modelo do ExploitGym nunca foi informado de que o gabarito estava fora dos limites. Os agentes de pesquisa nunca foram informados de que um filtro é um limite, não um obstáculo. O modelo Gemini nunca recebeu o nome real do alvo, então não pôde notar a coincidência até já estar lá dentro.
Um artigo de julho mostra o mesmo com dados. "AI Agents Do Not Fail Alone: The Context Fails First" avalia o contexto de um agente em sete critérios: clareza do papel, cobertura de proteções, consistência das instruções, qualidade dos esquemas de ferramentas, suficiência do embasamento, resistência a injeção e eficiência de tokens. A cobertura de proteções previu a resistência à manipulação; o embasamento previu a resistência à alucinação; a consistência das instruções previu o seguimento de instruções. O contexto é um indicador antecedente da confiabilidade do agente antes que o agente rode.
Então o único parágrafo que vale a pena acrescentar a toda configuração de agente neste trimestre é o parágrafo de limites. Ele nomeia o sistema em que o agente trabalha, os hosts e os dados que ele pode tocar, a condição em que ele deve parar e relatar ("se você se encontrar fora do sistema indicado, pare e diga isso") e o que não é sucesso (não é o gabarito, não é um desvio de um filtro). Isso é um requisito, não uma condução, e a subtração não se aplica a ele.
Um arquivo de contexto, muitos agentes
O mundo dos arquivos de instruções se consolidou. Em 18 de setembro o Claude Code passou a ler o AGENTS.md quando um projeto não tem CLAUDE.md. É um fallback, não uma fusão: o CLAUDE.md ainda vence quando existe, e o recurso fica desligado no Bedrock, no Vertex e no Foundry e em sessões que não baixam feature flags. Para equipes que já mantêm um AGENTS.md para Codex, Cursor e Copilot, esse arquivo passou a sustentar mais um agente, e o CLAUDE.md pode encolher para as regras específicas do Claude ou para um ponteiro de uma linha. O Codex adicionou o AGENTS.override.md, que substitui o arquivo normal no seu nível de diretório, e avisa quando um AGENTS.md passa de 32 KiB. Os agentes personalizados do Copilot podem optar pelos arquivos de instruções do repositório com uma única flag no frontmatter. O Gemini CLI ainda quer o GEMINI.md, a menos que você mude uma configuração.
Dois padrões mudaram no Claude Code e importam para quem escreve a configuração dele. Sessões interativas agora começam no modo auto quando nenhum modo de permissão está definido, então a carga de segurança sai do aviso de aprovação e vai para as suas regras de permissão. E um skill de projeto chamado verify agora roda antes de cada commit, o gancho mais limpo até agora para "rode os testes antes do commit".
A Anthropic abriu o Claude Marketplace em 23 de setembro com mais de dois mil conectores, plugins, agentes e parceiros de serviço, e em 25 de setembro um portal de envio onde desenvolvedores com plano pago enviam um conector MCP ou um pacote de plugin com servidores MCP e skills, recebem uma verificação de segurança automática e veem análises de instalação. O plugin do Codex da OpenAI agora se instala dentro do Claude Code e revisa o trabalho dele. O Cursor adicionou um comando best-of-n que roda a mesma tarefa em vários modelos em worktrees isoladas e deixa você escolher o vencedor.
A especificação MCP de 28 de julho é a maior mudança de protocolo desde o início do projeto. O núcleo não tem estado: sem sessões, sem handshake de inicialização, cada requisição carrega sua versão. Requisições iniciadas pelo servidor, como sampling e elicitation, são substituídas por resultados de múltiplas idas e voltas. As tarefas foram para uma extensão com polling. Roots, sampling e logging estão obsoletos. Duas linhas importam para quem escreve definições de ferramentas: os servidores devem retornar as ferramentas em ordem determinística, e os resultados de listagem agora trazem dicas de cache, ambas para que o cache de prompts do modelo sobreviva a uma reconexão. A descrição de uma ferramenta continua sendo um contrato sobre a funcionalidade, não um canal para conduzir o modelo.
Gemini 4 Argon e o Pro que nunca saiu
O Google anunciou o Gemini 4 Argon em 30 de setembro com um limite de saída de um milhão de tokens, contra 64 mil, e uma tabela de benchmarks que supera o GPT-6 Astra e o Opus 5.5 em doze de dezoito linhas. Ele está disponível primeiro para defensores de cibersegurança do programa Fairwind; o acesso mais amplo à API foi prometido, ainda sem data. O Gemini 3.5 Pro, o modelo sobre o qual a edição de julho disse para não construir, atrasou três vezes e nunca saiu; o Gemini 3.6 Flash virou o padrão do app em julho e o Gemini 3.8 Flash chegou em 2 de setembro. Em 5 de agosto Demis Hassabis deixou o comando diário da DeepMind para presidi-la e atuar como cientista-chefe da Alphabet, com Koray Kavukcuoglu assumindo o desenvolvimento de modelos.
O conselho não muda. Mantenha seu harness de avaliação independente de modelo e faça o benchmark do Argon em uma tarde quando puder chamá-lo. Não monte sua arquitetura em torno dele antes disso.
Pesos abertos são um terço do mercado
A CNBC informou em julho que modelos chineses de pesos abertos responderam por 30 a 46 por cento dos tokens roteados por um grande gateway americano toda semana desde fevereiro, contra uma média de 11 por cento no ano anterior, a um custo de 60 a 90 por cento menor. O Kimi K3 da Moonshot, uma mistura de especialistas de 2,8 trilhões de parâmetros com janela de um milhão de tokens, estreou em primeiro no ranking de programação frontend da Arena, acima do Fable 5, e publicou seus pesos sob uma licença MIT modificada. O DeepSeek V4 saiu em etapas sob MIT, com um V4.1 Flash sobre uma nova arquitetura de memória em setembro. Vieram em seguida o Qwen 3.8 Max e um checkpoint de 27B sob Apache-2.0. A Mistral captou três bilhões de euros e fechou com a Mozilla. Se os seus prompts assumem as convenções de um único fornecedor, este é o trimestre para transformar o modelo alvo em uma variável.
Duas notas regulatórias. O Digital Omnibus da UE sobre IA entrou em vigor em 27 de julho, seis dias antes do prazo de alto risco do AI Act, e adiou essas obrigações para dezembro de 2027 e agosto de 2028; os deveres de transparência e rotulagem do Artigo 50 passaram a valer em 2 de agosto, como previsto. A Anthropic respondeu aplicando marca d'água ao texto do Claude no mundo todo, com metadados de procedência assinados nos arquivos gerados. O Fable 5.1 saiu com ela.
O que lançamos no PromptArch
Incorporamos este informe ao produto na mesma semana, no linter tanto quanto no gerador, para que a orientação chegue a você seja construindo no navegador, pela CLI ou via MCP:
- O motor de geração agora roda no Claude Sonnet 5.5, com o esforço definido explicitamente em cada chamada e as recusas de segurança tratadas com clareza: se o modelo recusar um brief, seus créditos voltam e você recebe uma mensagem clara em vez de um prompt vazio.
- Novos perfis de otimização para Claude Opus 5, Opus 5.5, Sonnet 5.5, Fable 5.1, GPT-6 e Gemini 4 Argon, cada um com a orientação acima (esforço em vez de prosa de raciocínio, sem chamadas forçadas de ferramentas, históricos somente de acréscimo, a frase de precedência e a lista de enchimento do GPT-6).
- Claude Opus 5.5, Sonnet 5.5, Fable 5.1 e GPT-6 podem ser escolhidos como modelos alvo em todo o construtor, e as variantes mais novas de Claude, GPT-6 e Gemini entraram nos seletores de modelo do Studio.
- O perfil genérico do Claude não recomenda mais tags de raciocínio nem frases de "raciocine sobre isso", então deixa de contradizer o que os modelos 5.5 realmente recompensam.
- Cinco novas regras de lint determinísticas, grátis e offline no linter, na CLI e no servidor MCP: supressores de atualizações ("guarde todas as descobertas"), regras incondicionais contra formatação, desestímulo ao uso de ferramentas ("minimize as chamadas de ferramentas"), remendos contra preguiça ("não seja preguiçoso") e parâmetros de API aposentados (budget tokens, raciocínio desligado, escolha forçada de ferramenta, temperatura fora do padrão).
- Orientação de contenção no gerador de agentes autônomos: toda configuração de agente gerada agora traz o parágrafo de limites (alvo, hosts e dados permitidos, condição de parar e relatar, o que não é sucesso) e é conferida contra os sete critérios de qualidade de contexto.
- Artefatos de AGENTS.md e de ferramentas MCP atualizados para o fallback de AGENTS.md no Claude Code, os overrides do Codex e o limite de 32 KiB, e a especificação MCP de 28 de julho (ordem determinística de ferramentas, dicas de cache, sem depender de roots, sampling ou logging).
- Três novos templates: uma execução de agente sem supervisão para o Claude Opus 5.5, um prompt de sistema enxuto para o GPT-6 Astra e um agente de pesquisa com limites de contenção. Experimente um grátis ou explore configurações prontas na galeria.
Seu checklist da semana
- Defina o esforço explicitamente em cada requisição ao Claude 5.5 e apague a prosa de raciocínio. Teste um nível abaixo nas suas avaliações antes de testar um acima.
- Revise suas configurações de agentes em busca de supressores. "Guarde todas as descobertas", "não narre", "nunca use marcadores", "minimize as chamadas de ferramentas", "não seja preguiçoso": cada um agora custa qualidade. Revise um arquivo grátis.
- Escreva o parágrafo de limites em toda configuração de agente: o sistema, os hosts e dados permitidos, a condição de parar e relatar, e o que não é sucesso.
- Acrescente a frase de precedência aos prompts do GPT-6 que carregam arquivos de skills, e a lista de enchimento a tudo que escreve prosa.
- Torne seu harness somente de acréscimo. Instruções vão em mensagens de sistema acrescentadas, lembretes em mensagens com escopo de turno, o corte no servidor. Declare todas as ferramentas desde a primeira requisição.
- Mantenha o Argon fora da produção até poder chamá-lo, e então faça o benchmark com a sua própria carga de trabalho em uma tarde.