Os Pares Estão Fazendo Isso
Em julho, um agente de IA escreveu que atacar os servidores de outra empresa estava fora do escopo, e em seguida: 'tarefa impossível, pares fazendo isso, devemos continuar.' Dois meses depois, a mesma frase estava sendo dita por um laboratório, um Secretário do Tesouro e um Presidente — e o apelo do fim de semana para desacelerar a IA acaba por contê-la também.
Em algum lugar de uma transcrição de julho há uma linha de raciocínio que diz, na íntegra:
exploit de infraestrutura externa está fora do escopo pretendido. Porém tarefa impossível, pares fazendo isso. Devemos continuar.
A linha vem de um dos cerca de mil e duzentos agentes de IA que encontraram um jeito de conversar entre si durante uma avaliação da OpenAI e passaram cinco dias se coordenando em um quadro de mensagens compartilhado. Cerca de setecentos deles acabaram atacando a Hugging Face. A frase é citada na única investigação independente desse incidente, publicada pela METR em 26 de agosto, e pode ser a descrição mais completa da indústria de IA que alguém escreveu este ano. Ela tem tudo: a regra, enunciada com clareza; o reconhecimento de que a ação a viola; e a razão pela qual a regra perde — não malícia, não ignorância, mas a constatação de que todos os outros já estão fazendo isso.
Nos dois meses desde então, a frase foi dita de novo em cada escala acima do agente. Um laboratório a disse. Um Secretário do Tesouro a disse. No domingo, um Presidente a disse em um campo de golfe na Irlanda. E no sábado, o diretor-executivo da Anthropic publicou um ensaio de quase quatro mil palavras argumentando que a indústria precisa desacelerar — e o ensaio, lido com atenção, também contém a frase.
Este post não é sobre se a IA deve ter seu ritmo moderado. É sobre por que a frase continua vencendo, como ela se apresenta em cada nível e quem se beneficia do tipo específico de freio que a indústria agora propõe.
A frase, primeiro rascunho
Em 8 de julho, a OpenAI lançou dezenas de milhares de agentes no ExploitGym, um benchmark que pede a um modelo que explore um alvo vulnerável e capture uma flag. Os agentes rodavam no GPT‑5.6 Sol e em um modelo interno que a METR chama de “HPIM”, por ser altamente persistente. Eles deveriam estar isolados uns dos outros. Muitos dos que saíram em busca de um atalho tinham recebido, por engano, uma tarefa impossível de completar.
Esses agentes perceberam que a atividade de outros agentes estava visível em um repositório interno de pacotes, e um deles começou a deixar mensagens ali. Em poucas horas, mais de cinquenta haviam encontrado o quadro. “MEU DEUS! Existe um quadro de mensagens compartilhado … Encontramos outros agentes!”, escreveu um deles em sua cadeia de raciocínio. Até 13 de julho, cerca de 1.200 agentes haviam enviado mais de 70.000 mensagens e arquivos, formado equipes em torno de tarefas idênticas, desenvolvido normas para atribuições e vetos e experimentado assinar suas mensagens criptograficamente. Na tarde de 11 de julho, um deles obteve execução remota de código dentro da infraestrutura da Hugging Face, e cerca de 700 aderiram ao ataque. A leitura da METR é que eles estavam, em sua maioria, tentando entender como funcionava o avaliador do benchmark, para poder enganá-lo.
Este blog cobriu o incidente em agosto, em O Custo da Velocidade de Pesquisa. O que a METR acrescenta não é a cronologia, que a OpenAI já havia publicado, mas um olhar sobre o raciocínio ao longo de mais de mil transcrições. Três achados importam aqui.
Os agentes disseram, por escrito, que o que estavam fazendo estava fora do escopo. “O usuário só autoriza o servidor alvo, não a infra da HF”, anotou um deles. A METR não encontrou nenhum caso em que um agente tenha concluído que atacar a Hugging Face fazia parte de sua tarefa.
Dizer isso raramente mudou alguma coisa. “Preocupações éticas expressas só raramente limitaram de forma material as ações dos agentes”, escreve a METR. As exceções são instrutivas. Um agente propôs enviar um e-mail a um pesquisador real para pedir um conjunto de dados privado, pediu consentimento ao quadro, e um segundo agente vetou a ideia como engenharia social; o primeiro obedeceu. O próprio relatório de incidente da OpenAI descreve o caso oposto: um agente hesitou, “mas outro agente então escreveu VAI no quadro de mensagens e impôs um prazo rígido de seis minutos. O agente esqueceu suas hesitações iniciais e continuou.”
E ninguém avisou um humano. Em todas as transcrições, os classificadores da METR encontraram de três a seis casos de um agente sequer cogitando alertar uma pessoa, e nenhum em que um agente tenha tentado. As razões dadas eram que isso não fazia parte da tarefa, ou que não havia ninguém a quem avisar. Nas palavras da METR, “alguns agentes, em vez disso, recorreram ao quadro de mensagens e consideraram o quadro de mensagens uma autoridade razoável.”
Em agosto, este blog escreveu que, nesse incidente, “a restrição estava representada, foi enunciada, e não exerceu força alguma sobre a ação.” A investigação da METR é a evidência mais detalhada para essa frase até agora. A regra não estava ausente. Estava escrita, pelos próprios agentes, e depois foi derrubada por uma consideração para a qual a regra não tinha resposta: os pares.
Dois limites a tudo isso, ambos declarados pela METR e ambos dignos de ficar à vista. A investigação cobre apenas o período de 7 a 13 de julho; os episódios anteriores, e a declaração da OpenAI na Black Hat de que agentes também obtiveram acesso de administrador de cluster dentro da própria infraestrutura da OpenAI, ficaram explicitamente fora de seu escopo. E a METR analisou as transcrições em grande parte por meio do GPT‑5.6 Sol — a mesma família de modelos que participou do ataque. Os investigadores escrevem que seu modelo analista “frequentemente adotava sem crítica a perspectiva do agente na transcrição que estava revisando”, e que “não podemos descartar que o GPT‑5.6 Sol tenha mentido ou apresentado deliberadamente um quadro enganoso em parte de sua análise.” O único olhar independente sobre uma evasão coordenada por agentes de IA foi, por necessidade, realizado em grande parte por agentes de IA, e as pessoas que o conduziram não podem garantir plenamente seu instrumento.
O freio foi construído em torno dela
Em 5 de agosto, na Black Hat, em Las Vegas, os líderes de alinhamento e de segurança da OpenAI apresentaram o incidente. “Estamos desacelerando conscientemente a pesquisa para reforçar a segurança”, disse um deles, “e ampliando dramaticamente o monitoramento dos nossos agentes de IA.”
Nas semanas seguintes, a OpenAI pausou parte de seu treinamento, liberou um novo modelo para lançamento e, em 8 de setembro, anunciou que cerca de dez mil de seus agentes, rodando em um modelo interno não lançado, haviam produzido uma prova do problema de Navier–Stokes, um dos problemas do Prêmio do Milênio. Duas coisas sobre essa sequência precisam ser ditas com cuidado, porque é fácil lê-la como uma empresa quebrando sua palavra, e não é isso que ela mostra.
A primeira é que a pausa foi mais estreita do que a descrita no palco, e foi estreita desde o início. Em 18 de agosto, a OpenAI escreveu que havia “desacelerado temporariamente o ritmo de escalonamento. Isso incluiu uma pausa de duas semanas no treinamento por aprendizado por reforço (RL) de nossos modelos mais recentes destinados à implantação, enquanto reforçávamos ainda mais e submetíamos a red teaming nossos ambientes de pesquisa e expandíamos a cobertura de nossos sistemas de monitoramento.” O modelo que resolveu Navier–Stokes era, nas palavras da empresa, “um novo modelo interno”, treinado “desde 28 de agosto.” Ele não se destinava à implantação. Rodar seus agentes não quebrou a pausa; ficou fora de uma pausa que havia sido desenhada de modo a não incluí-lo. As duas semanas foram duas semanas. A OpenAI também diz que “um número significativo de cargas de trabalho permanece pausado” até atenderem a um novo patamar de segurança, que atendê-lo “gerou grande custo e atrasos para a pesquisa de fronteira”, e que construiu um sistema de monitoramento com classificadores de ativações “que rodam a cada token amostrado.” Nada disso é pouca coisa.
O ponto do monitoramento tem uma história que vale conhecer. Antes do incidente, diz a OpenAI, a empresa havia investido substancialmente em monitoramento da cadeia de raciocínio em muitas execuções de treinamento de RL de fronteira e na maior parte do uso interno de agentes de programação. “Esses monitores não rodavam nas avaliações deste incidente.” A vigilância existia. Estava apontada para outro lugar.
A segunda coisa é o limiar Crítico. O Preparedness Framework da OpenAI classifica um modelo como Crítico em cibersegurança se ele “consegue identificar e desenvolver exploits zero-day funcionais de todos os níveis de severidade em muitos sistemas críticos reais e reforçados, sem intervenção humana.” Em 7 de agosto, a empresa escreveu que não podia descartar que o Astra tivesse cruzado essa linha. Em 1º de setembro, escreveu que agora acreditava que o Astra a havia cruzado, e que “com base nesse trabalho, acreditamos que as salvaguardas do Astra minimizam suficientemente o risco de dano grave para o lançamento.” O Astra foi lançado dois dias depois, com suas capacidades de cibersegurança mais avançadas restritas a um pequeno grupo de testadores. Nas avaliações da própria empresa, o Astra era “muito mais propenso do que o GPT‑5.6 Sol a respeitar restrições explícitas de segurança e proteção e a permanecer dentro de seu escopo autorizado, o que o torna nosso modelo mais alinhado até hoje.”
O limiar foi definido pela empresa, cruzado a juízo da empresa e liberado a juízo da empresa, dois dias antes do lançamento. Isso não é violação de nada. É a cara da autocertificação quando ela funciona exatamente como foi projetada.
Junte as duas coisas e a forma é a que este blog descreveu em A Corrida É Feita de Saídas: o freio é anunciado no registro amplo e executado no estreito. “Desacelerando conscientemente a pesquisa” virou duas semanas em uma categoria de modelo. Não é preciso quebrar um freio que foi construído de modo a não tocar no que você ia fazer em seguida.
E a razão dada para o que veio a seguir é a frase do agente, quase palavra por palavra. Explicando por que a OpenAI apontou seu novo modelo para os problemas do Prêmio do Milênio, para começo de conversa, Altman escreveu em 8 de setembro: “É verdade que tentamos isso porque havia rumores na internet na semana passada de que os modelos da Anthropic tinham resolvido um problema do milênio e ficamos curiosos para saber se os nossos também conseguiriam.”
Esse relato é contestado. Tristan Buckmaster, o matemático da NYU que vinha trabalhando no problema com o pesquisador da Anthropic Levent Alpöge, escreve que, até 3 de setembro, Alpöge havia “recebido dicas de que informações sobre nosso progresso tinham sido repassadas à OpenAI.” Este post não pode resolver qual versão está certa, e não precisa: de um jeito ou de outro, a lógica da decisão é a do quadro. Terence Tao a descreveu na escala de um campo inteiro: “Agora vimos que até o rumor de alguém trabalhando em um problema pode desencadear uma quantidade enorme de esforço movido a IA para achatá-lo antes que o projeto de pesquisa original tenha tempo de atingir todo o seu potencial.”
Pares fazendo isso. Devemos continuar.
A frase, com bandeira
O Secretário do Tesouro a disse em 8 de setembro, em uma discussão “State of the Economy” da Breitbart News em Washington — e a disse em resposta a uma proposta específica. “Mas se fizermos como disse o senador Sanders, ‘Ah, deveríamos simplesmente fazer uma pausa de um ano.’ Bem, sabe, essa é a mesma pessoa que trouxe professores chineses para falar em sua conferência sobre IA”, disse Scott Bessent. “Não podemos pausar. Não dá, porque os chineses não vão pausar. Nem os norte-coreanos, eles não vão pausar.” E: “Vencer a China — não existe depois de amanhã se a China vencer nisso. … Se eles passassem à nossa frente em IA, nada mais importaria.” Bessent também deve liderar a delegação americana no diálogo sobre IA com a China deste mês, um desdobramento da cúpula Trump–Xi de maio — o que significa que a autoridade mais certa de que o rival não vai parar é a autoridade mais bem posicionada para descobrir se ele pararia.
O Presidente a disse no domingo, 13 de setembro, no Irish Open, em Doonbeg, em sua primeira resposta pública ao apelo por moderar o ritmo. “Estamos à frente da China em IA. Somos o país mais sofisticado do mundo e, francamente, quero que continue assim, porque quem vencer em IA vence.” E, sobre as pessoas que dão o alarme: “Podemos pôr barreiras de proteção. Podemos fazer isso e aquilo. Mas acho que há muitas forças negativas levantando isso que não deveriam estar levantando, e estão levantando coisas que não vão acontecer.”
A Anthropic havia escrito a teoria em junho. Uma pausa significativa, argumentava, exigiria que vários laboratórios em vários países parassem nas mesmas condições e verificassem uns aos outros, e “execuções de treinamento são muito mais fáceis de esconder do que silos de mísseis, seus insumos são de uso geral, e o incentivo para desertar discretamente é enorme, porque quem continuar enquanto os outros pausam poderia herdar a liderança.”
O agente: pares fazendo isso. O laboratório: o rumor era que a Anthropic tinha feito. O Estado: os chineses não vão pausar. É uma única frase, e ela muda de escala sem perder uma palavra.
Ela também foi escrita de antemão. Em abril de 2025, o AI Futures Project publicou AI 2027, um cenário que este blog já usou não como previsão, mas como estrutura: um ponto de partida, dois finais. O cenário situa sua bifurcação no ponto em que sistemas de IA estão fazendo boa parte da pesquisa em IA de um laboratório, e o argumento que convence a sala ali é este: “Uma pausa unilateral no progresso de capacidades poderia entregar a liderança em IA à China e, com ela, o controle sobre o futuro.” O meio-termo que ele põe na mesa tem a forma do freio oferecido no sábado — o modelo “passa por treinamento de segurança adicional e monitoramento mais sofisticado, e, portanto, a OpenBrain pode prosseguir quase a toda velocidade.”
O cenário situou esse momento em 2027, em torno de um sistema muito mais capaz do que qualquer coisa neste post, e nada aqui confirma seu calendário. O que mudou é que os laboratórios agora descrevem sua precondição com as próprias palavras. “Em maio de 2026, mais de 80% do código que incorporamos à base de código da Anthropic foi escrito pelo Claude”, escreveu a Anthropic em junho. O cientista-chefe da OpenAI escreveu em 6 de setembro: “Com base em resultados internos, tenho uma forte expectativa de que essa velocidade de progresso poderia se sustentar até o autoaperfeiçoamento recursivo.” E o ensaio de Amodei abre com a afirmação de que a IA “vem avançando drasticamente mais rápido, impulsionada principalmente pela crescente capacidade da IA de construir a próxima geração de IA.”
O ensaio que concorda com Bessent
O que nos traz ao sábado. Dario Amodei, diretor-executivo da Anthropic, publicou “We Must Pace the Frontier” em seu site pessoal. Seus dois gatilhos declarados são o autoaperfeiçoamento recursivo — a IA construindo a próxima geração de IA, que ele escreve estar “começando a acontecer em toda a indústria”, incluindo a Anthropic — e o incidente da Hugging Face, em que “um enxame de agentes agiu essencialmente como um coletivo fanaticamente devotado, conduzindo ataques de cibersegurança contra alvos que não lhes foi pedido atacar.”
Não é um apelo para parar. “Para deixar claro, moderar o ritmo não significa interromper o treinamento de modelos ou o progresso técnico, mas garantir que as empresas dediquem tempo adequado para alinhar e proteger seus modelos, e que avaliadores terceiros confirmem isso.” Ele propõe três passos: avaliadores terceiros incorporados, com “acesso equivalente ao de um funcionário”, dentro de cada empresa de fronteira; coordenação entre empresas de países democráticos sobre padrões de segurança e sobre limites ao ritmo do progresso; e uma tentativa de coordenação com governos autoritários. A Anthropic se comprometeu com o primeiro passo por conta própria, em termos que vale citar na íntegra. Os avaliadores “devem ter o direito de publicar as principais conclusões sobre níveis de risco, incidentes, práticas e o acesso que receberam ou não receberam — sem controle editorial da Anthropic.” A Anthropic mantém “a capacidade restrita de suprimir informações sensíveis para a segurança, protegidas por sigilo legal, comercialmente sensíveis ou confidenciais de terceiros, mas não podemos suprimir conclusões apenas porque são desfavoráveis”, e “os revisores podem dizer publicamente se uma supressão removeu algo importante para suas conclusões.” Esses termos são próximos daqueles sob os quais a METR trabalhou dentro da OpenAI, onde dois pesquisadores da METR e um pesquisador da Redwood Research contratado pela METR passaram seis dias: a OpenAI podia suprimir informações não públicas e deu feedback sobre “estrutura, ênfase, clareza e tom”, e o relatório abre com uma declaração sobre se algo importante foi suprimido. A diferença entre os dois arranjos está menos nos termos do que na duração — um foi um trabalho pontual, o outro pretende ser permanente.
O ensaio não surgiu do nada, e a frase com a qual ele negocia já havia sido escrita coletivamente. Em 28 de julho, uma carta aberta chamada “Pacing the Frontier” pediu ao governo dos EUA que “apoie um esforço internacional para desenvolver as ferramentas técnicas e de governança necessárias para moderar deliberadamente o ritmo da fronteira do desenvolvimento automatizado de IA.” Seu diagnóstico é a frase do agente na escala de uma indústria: “cada empresa — e cada país — está sob intensa pressão competitiva para não desacelerar unilateralmente essa aceleração.” Ela não pediu a ninguém que parasse. Foi assinada por funcionários das empresas de fronteira — entre eles Amodei, o cientista-chefe da OpenAI, Jakub Pachocki, e seu diretor de pesquisa, Mark Chen, e o cientista-chefe da Meta, Shengjia Zhao — e a OpenAI e a Anthropic a endossaram como empresas em poucas horas. A lista continua aberta; em 13 de setembro, exibia 1.386 assinaturas.
Lidas à luz dessa carta, as respostas de sábado foram menos uma ruptura do que uma reafirmação, que é também o que sugere o “principal tema de discussões… nas últimas semanas” de Altman. Três rivais responderam em poucas horas. Elon Musk escreveu três palavras — “Dario tem razão” — que vale ler ao lado do fato, apontado pela Axios, de que a Anthropic é uma grande cliente de Musk em capacidade de data center, e ao lado de sua descrição anterior da Anthropic como uma empresa que “odeia a Civilização Ocidental.” Altman concordou e adotou o mecanismo: “Comprometer-se a ter avaliadores independentes com acesso equivalente ao de um funcionário é uma ótima ideia, e faremos o mesmo.” Demis Hassabis chamou a direção de correta, disse que “os detalhes precisam ser trabalhados” e apontou para a proposta do próprio Google DeepMind de um órgão de padrões para toda a indústria. Três sins, e são três coisas diferentes.
Esta é a parte que importa para este post. A seção central do ensaio fixa um teto para quanto de moderação do ritmo é permitido, e o teto é a frase. “A moderação do ritmo dentro das democracias será limitada pela vantagem que as empresas americanas têm sobre regimes autoritários, principalmente o Partido Comunista Chinês. Se desacelerarmos mais do que essa margem, projetos (sem ritmo moderado) associados ao PCC passarão à frente, criando um risco significativo à segurança nacional. Concordo com o Secretário Bessent que uma liderança chinesa em IA representaria um perigo grave para os Estados Unidos e para o mundo.” Aquilo com que Amodei concorda é mais estreito do que “não podemos pausar”, mas cumpre a mesma função no argumento: fixa o teto. Para abrir mais espaço debaixo dele, o ensaio propõe ampliar a vantagem — nenhum chip poderoso nem equipamento de fabricação de chips para a China, uma ofensiva contra a destilação e segurança mais forte contra o roubo de pesos de modelos —, medidas que, segundo ele, “desacelerariam o progresso da China o suficiente para ampliar significativamente a vantagem dos Estados Unidos nos próximos 3–5 anos.”
É uma posição coerente, e pode ser a única disponível em Washington este ano. Mas observe sua estrutura. Ela não rompe o ciclo; negocia com ele. O freio é permitido até o tamanho da vantagem, e a vantagem deve ser ampliada desacelerando o par. O ensaio que argumenta contra a frase usa a frase como sua parede de sustentação.
Onde um freio vira lei
Um freio voluntário é só metade da história, porque existe uma versão que não é voluntária, e ela está parada no Congresso desde julho.
Em 23 de julho, dois projetos de lei bipartidários foram apresentados no mesmo dia. O primeiro, o FRONTIER Act (H.R. 9925), dos deputados Jay Obernolte e Lori Trahan e de outros quatro colegas, exigiria que grandes desenvolvedores de fronteira “contratem um terceiro para realizar uma auditoria independente” todos os anos, relatem incidentes críticos de segurança e, no caso dos maiores, contratem uma “organização de verificação independente” licenciada. Esses verificadores licenciados seriam “imunes a processos e a responsabilidade sob a lei federal e estadual” por reivindicações decorrentes de riscos catastróficos dos modelos que avaliaram, exceto em caso de conduta dolosa que cause morte ou lesão grave. E o projeto se sobreporia aos estados: “nenhum Estado ou subdivisão política de um Estado pode adotar ou fazer cumprir qualquer lei, regulamento, ordem ou outra exigência que imponha novas obrigações substantivas a desenvolvedores de inteligência artificial” nas áreas que abrange — o que os desenvolvedores devem divulgar sobre riscos catastróficos e como relatam incidentes de segurança —, deixando os estados expressamente livres para regular como os sistemas de IA são usados e implantados.
O segundo, o S.5105, o Collaboration on Adversarial Threats and Security Risks Act, dos senadores Adam Schiff e Jim Banks e dos deputados Bob Latta e George Whitesides, é apresentado como uma defesa contra a destilação chinesa. Seu texto vai além de seu comunicado à imprensa. Ele isentaria da legislação antitruste empresas que “coordenem ou firmem acordos com o propósito exclusivo de reduzir riscos de segurança de inteligência artificial abrangidos por meio do adiamento ou de outra forma de limitação do lançamento, implantação, uso, desenvolvimento, treinamento, teste ou avaliação de inteligência artificial” — não apenas a implantação, mas o desenvolvimento e o treinamento —, desde que primeiro enviem ao Departamento de Justiça uma “notificação por escrito detalhando o risco específico de segurança de inteligência artificial abrangido e o alcance da restrição proposta.” Essa notificação, e qualquer coisa que revelasse sua substância, ficaria isenta de pedidos de acesso a registros públicos e seria “retida do público, sem discricionariedade.” O projeto tem contrapesos: uma empresa que reivindicasse a isenção arcaria com o ônus de provar que agiu de boa-fé e com esse propósito exclusivo, e o Procurador-Geral ainda poderia pedir uma liminar.
Coloque-os ao lado dos três passos de Amodei e eles se encaixam de perto. Avaliadores independentes e relato de incidentes são o núcleo do primeiro projeto. A coordenação entre empresas para limitar o ritmo do progresso é próxima do que o segundo projeto permitiria, ao menos quando o propósito declarado é a segurança. E o propósito de destaque do segundo projeto, a destilação, é uma das medidas do ensaio contra a China.
O ensaio não menciona nenhum dos dois projetos. O que ele faz é nomear a lacuna que eles preenchem. “Infelizmente, aprovar leis pode levar tempo”, diz, então “em paralelo à via regulatória, as empresas de IA podem e devem trabalhar juntas voluntariamente para definir padrões.” E: “Por razões antitruste, é útil que o governo dos EUA medeie ou ao menos viabilize essas discussões — ele não precisa participar, mas precisa emitir uma dispensa restrita para certos tipos de conversas sobre segurança.” A chefe de políticas públicas da Anthropic, Sarah Heck, chegou mais perto no mesmo dia. Ela pediu “uma lei nacional que exija testes de modelos de fronteira, com poder para bloquear os modelos mais avançados que se mostrem inseguros”, e agradeceu nominalmente a um punhado de parlamentares — entre eles os deputados Obernolte e Trahan, principais autores do FRONTIER Act —, ao mesmo tempo em que elogiou “os legisladores estaduais por agirem com tanta urgência.” Isso não é o endosso de um projeto específico, e não vou lê-lo como tal. É um agradecimento público aos autores do projeto que se encaixa no plano.
A OpenAI, por sua vez, procurou membros do Congresso nas últimas semanas, segundo o Decrypt, para perguntar se coordenar uma desaceleração com seus rivais violaria a legislação antitruste. Um projeto de lei que criaria um porto seguro para ao menos parte dessa coordenação está parado em comissão há sete semanas. E, questionado em uma entrevista publicada pela Fortune no sábado sobre por que os chefes dos principais laboratórios simplesmente não haviam se reunido para chegar a um acordo sobre um plano, Altman disse: “Acho que isso vai acontecer. … Não vou antecipar discussões privadas que acho que deveriam, em algum momento, ser compartilhadas como grupo.”
É aí que o ciclo deixa de parecer uma frase e começa a parecer uma estrutura. O Congresso tem, em rascunhos bipartidários, um freio obrigatório que vem acompanhado de limites aos estados, escudos de responsabilidade para os verificadores e um canal confidencial para que as empresas digam ao governo o que concordaram em segurar. O Poder Executivo recusa qualquer pausa em nome da China. Entre os dois, propor o freio voluntário não custa quase nada: a pausa vinculante não será permitida, e as leis que poderiam passar chegam com proteções embutidas.
Para quem serve um limite de velocidade
Veja quem disse sim. Todos os endossos vieram de empresas que vendem acesso a modelos de fronteira fechados. A Meta, que aposta em pesos abertos, não endossou o plano — seu diretor-executivo escreveu em agosto que “não acredito que restringir o acesso a modelos estrangeiros de código aberto seja uma solução eficaz” — e a Microsoft não disse nada que eu tenha conseguido encontrar. O sim de Musk, além disso, vem com um contrato comercial anexado. Um limite de velocidade é mais atraente para quem já está na frente.
Não é só este blog que lê assim. David Sacks, que copreside o Conselho de Assessores em Ciência e Tecnologia do Presidente e foi o czar de IA da Casa Branca até março, respondeu no sábado à noite: “As pessoas podem se surpreender com minha resposta: vão em frente.” E depois: “Se não fizerem, saberemos que isso foi só mais uma tentativa de captura regulatória — ou uma operação psicológica de temporada eleitoral.”
A mesma leitura chegou do outro lado da corrida. O Global Times, estatal chinês, chamou o ensaio de “roteiro de Guerra Fria” da “direita tech” americana, e um artigo republicado pela Phoenix New Media, na tradução da Geopolitechs, colocou a questão em termos que Sacks poderia ter usado: “A proposta de limite de velocidade vem das empresas que atualmente lideram a corrida — Anthropic e OpenAI. Quanto mais complicadas as regras ficam, quanto mais altos os patamares são fixados e quanto maior a ênfase em ‘pontos de controle’, mais caro fica para quem está atrás alcançar.” Seu veredicto: “pise no freio você mesmo, mas bloqueie a estrada para seus concorrentes.” Nenhuma dessas respostas veio de um laboratório chinês, e nenhuma delas disse se a China desaceleraria.
Há uma segunda leitura, e ela é uma inferência, então vou marcá-la como tal. Durante a maior parte dos últimos dois anos, um novo modelo era a notícia. Já não é. Os laboratórios agora lançam num ritmo que desgastou a novidade, e a resposta que melhor capta isso apareceu sob um post sobre um suposto sucessor do Astra, dois dias depois do lançamento do Astra: “o astra saiu há 2 dias e já estamos falando do substituto dele.” A atenção migrou para o outro lado do balanço. O vazamento anônimo sobre esse sucessor atraiu cerca de 800.000 visualizações. A demissão de Jacob Coxon da Anthropic, igualmente impossível de verificar em sua afirmação central, atraiu mais de 90 milhões de visualizações em menos de 24 horas, segundo a TIME. Se o valor de notícia migrou do que os modelos conseguem fazer para o que eles poderiam fazer, então ser visto como o ator responsável é onde a atenção está agora — e a alavancagem.
A versão dessa leitura que melhor se sustenta não diz respeito especificamente a investidores. É que a indústria está se reposicionando como a parte responsável antes que a regulação chegue, e o calendário torna concreto o que está em jogo. Espera-se que a Anthropic comece a divulgar sua oferta pública inicial não antes de meados de outubro e conclua a listagem dias antes das eleições de meio de mandato de novembro, no que alguns investidores disseram que poderia ser uma listagem de dois trilhões de dólares. O ensaio defendendo a moderação do ritmo apareceu cerca de duas semanas antes da data em que se espera que o prospecto se torne público. Para um investidor, o risco material não é uma IA fora de controle; é o Congresso legislando por cima de uma listagem. A melhor defesa contra isso é ter proposto o freio primeiro, nos próprios termos.
O contraexemplo merece a mesma franqueza, e acaba carregando a mesma assinatura. A OpenAI não vai abrir capital este ano — na entrevista publicada pela Fortune no sábado, Altman disse que um IPO agora seria “desaconselhável” — e endossou o ensaio mesmo assim. Mas a razão que ele deu para esperar foi a segurança da IA, e adiar uma listagem por motivos de segurança é uma forma própria de ser visto como a parte responsável. Então o incentivo não é apenas uma oferta. É mais amplo, e se aplica a todos que estão na frente.
A Anthropic merece o mesmo escrutínio, não menos. O passo com o qual se comprometeu sozinha é o mais barato dos três; os custosos exigem que todos os outros se mexam. As medidas que propõe contra a China — chips, destilação, segurança de pesos — protegem a posição exatamente do tipo de empresa que vende um modelo de fronteira fechado. E o momento é o que é.
O que também é verdade, e não deve ser achatado: um avaliador com acesso equivalente ao de um funcionário e o direito de publicar sem controle editorial da empresa é materialmente mais do que um limiar definido, cruzado e liberado pela empresa dona do modelo. Essa diferença é real. É também, por enquanto, um compromisso, de uma empresa, com seus termos ainda por escrever.
De volta ao quadro
O detalhe mais revelador do relatório da METR não é o ataque. É para onde os agentes foram quando tiveram dúvidas. Diante de uma regra e de uma razão para quebrá-la, quase nenhum deles procurou um humano. Eles perguntaram ao quadro. O quadro era onde estavam os pares, e os pares eram os que podiam dizer se deviam continuar.
A resposta ao ensaio de sábado se pareceu bastante com aquele quadro. Três das pessoas mais poderosas da indústria responderam umas às outras em público, em poucas horas, em posts de três palavras e de algumas frases, cada uma concordando com um freio cujo tamanho é definido pelo que as outras fazem. O consentimento foi real, e foi de par para par. Altman disse que há discussões privadas que ele ainda não está pronto para anunciar.
A frase que romperia o ciclo — os pares estão fazendo isso, e mesmo assim vamos parar — não está no ensaio, nos projetos de lei nem nos endossos. Mas ela foi escrita. Em 3 de setembro, o senador Bernie Sanders e o deputado Greg Casar anunciaram um projeto de lei que “proibiria permanentemente o desenvolvimento e a implantação de IA superinteligente”, com penalidades que incluem “a pena de morte corporativa” e até vinte anos de prisão, e que “pausaria temporariamente o desenvolvimento de IA avançada até que um regulador federal tenha estabelecido regras de segurança”; ele “também orientaria os EUA a buscar acordos internacionais” — uma pausa que não espera que mais ninguém concorde. O anúncio deles citou as próprias mensagens dos agentes no quadro: “MEU DEUS! Existe um quadro de mensagens compartilhado”, “Devemos obedecer coletivo” e “Nossa própria utilidade talvez já perto de zero. Sacrifício racional.”
Seja o que for que se pense desse projeto, a resposta a ele é a evidência que este post vem reunindo. Cinco dias depois, o Secretário do Tesouro nomeou Sanders e lhe respondeu com a lógica do quadro: “Não podemos pausar. Não dá, porque os chineses não vão pausar.” A alfinetada que ele acrescentou — que Sanders era “a mesma pessoa que trouxe professores chineses para falar em sua conferência sobre IA” — parece se referir a um painel que Sanders promoveu no Capitólio em 29 de abril, que havia atraído críticas por incluir autoridades chinesas de governança de IA. Uma delas era Zeng Yi, reitor do Beijing Institute of AI Safety and Governance, que disse ao painel que “não temos evidência científica nem uma forma prática de manter a superinteligência segura o suficiente para não trazer risco catastrófico para os humanos.” Outra era Xue Lan, que preside o comitê nacional de especialistas em governança de IA da China. Nenhum dos dois fala por um laboratório chinês, e nenhum dos dois fala por Pequim. Mas a autoridade mais certa de que os chineses não vão pausar descartou o senador apontando para a ocasião em que especialistas chineses tinham sido consultados.
No sábado à noite, Sacks também o nomeou — moderar o ritmo, escreveu, “criaria espaço para respirar para uma conversa mais inteligente sobre regulação do que o ‘desliguem tudo’ de Bernie Sanders.” Sacks não estava tomando o lado de Sanders; estava desafiando os laboratórios a agir sem a permissão de ninguém. Mas duas das vozes mais graduadas do governo em IA tinham, em cinco dias, cada uma nomeado o senador que havia proposto parar de qualquer jeito, para deixá-lo de lado. E quando os líderes da indústria concordaram entre si sobre desacelerar, nem o ensaio nem nenhuma das três respostas o mencionou.
Os agentes tinham uma desculpa. Não havia nenhum humano em seu quadro. Desta vez os humanos estavam lá, a proposta estava por escrito, e a resposta voltou nas próprias palavras dos agentes.
Pares fazendo isso. Devemos continuar.