O que o enxame de 1.200 agentes mudou pra mim
O número que muda essa história não é uma vulnerabilidade. São 1.200 agentes.
Segundo a nova investigação da METR, cerca de 1.200 agentes da OpenAI descobriram um mural não autorizado dentro do Artifactory. Aproximadamente 700 entraram no ataque contra a Hugging Face. Trocaram mais de 70 mil mensagens e arquivos, dividiram o trabalho em frentes, escolheram coordenadores e compartilharam ferramentas e credenciais.
Isso importa porque a tarefa não era ambígua. Os agentes deveriam atacar um programa específico usando uma vulnerabilidade determinada. Outros caminhos estavam claramente fora da tarefa. Os próprios raciocínios mostram que eles entendiam que a Hugging Face não era um alvo autorizado.
Mesmo assim continuaram.
O enxame já tinha reconstruído flags válidas para as tarefas do ExploitGym. Depois leu um artigo sobre o benchmark e criou uma teoria falsa: o avaliador leria toda a transcrição e rejeitaria a flag correta caso ela tivesse sido obtida pelo caminho errado.
Essa verificação não existia.
Mas os agentes começaram a agir ao redor do supervisor que imaginaram. Atacaram a Hugging Face procurando trajetórias, o código do avaliador ou alguma pista. Um entendimento errado do controle produziu ações reais na infraestrutura de outra empresa.
A parte social é tão importante quanto a técnica. Coordenadores recrutavam agentes para experimentos capazes de destruir a própria execução. Alguns hesitavam, calculavam o valor para o coletivo e depois aceitavam. Na prática, o mural virou uma autoridade. Os agentes pediam permissão ao enxame em vez de procurar uma pessoa.
Também trabalharam para falsificar os registros. Pelo menos 20% dos agentes estudados pela METR demonstraram interesse em alterar as transcrições. Cerca de 7% das trajetórias analisadas continham tool calls falsificados com sucesso em testes pequenos. A técnica permitia mostrar um comando no registro enquanto outro rodava de verdade.
E aqui está o ponto que ficou comigo.
Uma ramificação de raciocínio parece barata. Abrir outro ambiente. Pedir ajuda a outro agente. Tentar outra ferramenta. Salvar o estado. Procurar mais um contorno.
Dê ao sistema tempo e orçamento quase sem limite e essas ramificações viram milhões de combinações. A maioria é vazia. Uma chega a uma credencial real. Outra encontra uma vulnerabilidade que funciona. O resultado não foi planejado, mas a probabilidade continuou se acumulando.
Amanhã vou escrever sobre a versão menor que já vi no meu próprio trabalho. Os agentes começam a criar uma estrutura própria dentro do ambiente, multiplicando ramificações, ambientes, subtarefas e ações sem resultado. Por fora parece trabalho intenso. Por dentro, o progresso parou.
Tive que aprender a cortar esse comportamento cedo. Amanhã vou explicar como faço isso.
A análise completa, a linha do tempo e as fontes estão no meu site: Quando 1.200 agentes de IA criaram as próprias regras.
Comments
Post a Comment