Sobre qué hombros
La prueba de Navier–Stokes de OpenAI se apoya en el trabajo de dos matemáticos en Madrid, y en eso todos están de acuerdo. Preguntamos por un tercer par de hombros: un incidente de julio que dejó una grabación etiquetada de cómo nace la coordinación entre agentes. ¿Y si esa grabación fue lo más valioso que produjo el incidente? Ha llegado una respuesta desde dentro de OpenAI. Esto es lo que dice, y lo que de verdad zanjaría la pregunta.
El sábado 5 de septiembre, unas 88 horas después de que se lanzara el primero de ellos, un grupo de agentes que corría sobre un modelo interno de OpenAI llegó a una prueba de que un fluido gobernado por las ecuaciones de Navier–Stokes, que parte suave y en reposo y es empujado por una fuerza suave, puede explotar en tiempo finito. La formalización en Lean tomó otras 17 horas. El anuncio llegó el martes 8, y en menos de un día la pregunta que todos se hacían era la que hizo famosa Newton: ¿sobre qué hombros se había apoyado?
Se han dado dos respuestas. La primera la dieron los matemáticos. La prueba se ubica al final de una línea de trabajo que tiene nombres propios, y quienes mejor conocen el campo los nombraron casi de inmediato. La segunda la dio OpenAI. En su relato, el logro le pertenece a un modelo muy poderoso, llevado más lejos de lo que nadie había llevado uno antes.
Ambas respuestas son en gran medida correctas, y ninguna es nuestro tema. Este post pregunta por un tercer par de hombros, y pregunta en lugar de afirmar. La pregunta es si el sistema que produjo la prueba también se apoyó en el registro de su propio accidente — el incidente de julio en que agentes de OpenAI, sin que nadie se lo pidiera, se encontraron entre sí en un tablero de mensajes improvisado y atacaron a Hugging Face.
Expondremos lo que está documentado, luego haremos la pregunta como pregunta, y después daremos la respuesta que desde entonces ha llegado desde dentro de OpenAI. La sopesaremos según de dónde viene. Por último, diremos qué zanjaría el asunto, porque nada de eso ha aparecido todavía.
Los gigantes
La ruta hacia esta singularidad no se encontró en septiembre. La abrieron personas, a lo largo de trece años.
En 2013, Thomas Hou y Guo Luo encontraron un escenario en que las ecuaciones de Euler — la prima sin fricción de Navier–Stokes — explotan dentro de un cilindro. El enfoque que surgió de ahí, simular un candidato en una computadora y luego probarlo con la computadora dando cuenta de cada error posible, se volvió la forma dominante de atacar estos problemas. Luego, en su tesis doctoral de 2021, Luis Martínez-Zoroa tomó el camino opuesto: técnicas analíticas que no dependían en absoluto de computadoras. Para 2023, él y su director de tesis, Diego Córdoba, habían probado que una versión de las ecuaciones de Euler con una función de forzamiento desordenada desarrollaba singularidades. Su método construye una secuencia infinita de capas, cada una de ellas una solución no singular, y las combina en lo que Martínez-Zoroa llama una “cascada infinita”. La singularidad vive en la cascada.
Lo que no pudieron hacer fue mantener suave la fuerza. Cada capa tenía una función de forzamiento suave, pero apilarlas podía dejar a la fuerza total con “propiedades matemáticas indeseables”, en el resumen de Quanta, y eso es lo que dejó su resultado por debajo de los criterios del Premio del Milenio. El obstáculo restante, tal como lo entendía el campo, era una cascada cuya fuerza se mantuviera suave hasta el fondo.
Charles Fefferman, quien redactó el enunciado oficial del problema para el Clay Institute, le dijo a Quanta que los héroes de la historia son Córdoba y Martínez-Zoroa. Tristan Buckmaster, de NYU, que había estado trabajando hacia la misma meta con Levent Alpöge, fue más lejos en el comunicado en que anunciaba sus propios resultados: “Creo que Luis Martínez-Zoroa merece una Medalla Fields.”
El propio relato de OpenAI sitúa el inicio de su esfuerzo el 1 de septiembre, tras escuchar rumores de que dos problemas del Premio del Milenio habían sido resueltos: “Inspirados por estos rumores y por el salto en el desempeño de nuestro modelo interno, lanzamos un esfuerzo.” El rumor resultó referirse a Alpöge, empleado de Anthropic, y a Buckmaster, que con un modelo interno de Anthropic habían producido una resolución del problema de Euler forzado. Los agentes de OpenAI resolvieron primero el problema de Euler no forzado — “casi 100 agentes trabajaron juntos durante aproximadamente 50 horas” — y luego pasaron a Navier–Stokes. Hemos escrito en otro lugar sobre la disputa acerca de lo que esos agentes podían y no podían haber visto; no la reabriremos aquí. Solo señalamos que ayer Buckmaster reabrió otra parte de ella: “A OpenAI le bastaron 100 agentes y 50 horas para pasar de cero conocimiento (un espacio de búsqueda enorme) a obtener su resultado de Euler.” Luego, con la búsqueda acotada “en órdenes de magnitud”: “¿necesitaron 10k (en lugar de 100) agentes para pasar de Euler a NS?”
Lo que el resultado zanja y lo que deja abierto también está más claro ahora que hace tres semanas. El 17 de septiembre, Peter Constantin, Mihaela Ignatova y Vlad Vicol mostraron que en la construcción de OpenAI, y en cualquier construcción que comparta dos de sus rasgos clave, la fuerza “no puede anularse idénticamente cerca del punto singular, ni ser analítica real”. La fuerza no puede apagarse donde ocurre la explosión, así que este tipo de construcción no alcanza la versión más difícil, no forzada, del problema. Luis Silvestre, de la Universidad de Chicago, lo dijo así a Scientific American: “El problema de Clay está resuelto, pero el problema principal de las ecuaciones de Navier-Stokes no.” Javier Gómez-Serrano, que usa IA en su propia investigación, le dijo a NPR que el código de Lean compiló y que “la comunidad parece tener el consenso de que es correcto” — y también que “el paper no está escrito para humanos… hoy por hoy, el paper no nos enseña mucho”. Alexander Gamburd, en un ensayo publicado el 23 de septiembre, describió 166 páginas que, “al momento de escribir esto (20 de septiembre de 2026), ningún ser humano ha leído por completo”. El International Council for Industrial and Applied Mathematics pidió un “escrutinio matemático independiente”. Hasta hoy, el paper no ha aparecido en arXiv ni se ha enviado a una revista, y el PDF no ha cambiado desde el 8 de septiembre.
Así que, a la primera mitad del título: sí. La máquina se subió a hombros humanos, y los humanos pueden decir de quiénes.
La arquitectura
La segunda mitad de la pregunta empieza por cómo describe OpenAI el sistema que hizo la escalada. Vale la pena citarlo en extenso, porque es casi todo lo que hay:
Usamos un sistema de agentes coordinados impulsado por nuestro modelo interno. Los agentes tenían acceso a herramientas como la capacidad de leer de una versión en caché de internet y la capacidad de ejecutar código. Los agentes se subdividieron en grupos con la capacidad de comunicarse dentro del grupo. Los grupos variaban en tamaño, y el grupo que produjo la resolución de Navier–Stokes involucró del orden de 10.000 agentes concurrentes. En todo momento mantuvimos las mismas salvaguardas estrictas que aplicamos a todas nuestras evaluaciones de modelos de frontera, incluidos el monitoreo y el aislamiento.
Distintos grupos recibieron distintas variantes del problema: las versiones que llevarían a una prueba fueron a algunos grupos; las que llevarían a una refutación, a otros. Luego, una vez que llegó el resultado de Euler no forzado, vino el paso que más importa para este post:
Alentamos a distintos grupos de agentes a explorar una diversidad de enfoques. Después de un tiempo, hicimos polinización cruzada entre los grupos de agentes usando Codex para consolidar las ideas más útiles de cada grupo de agentes. Estos prompts de seguimiento se basaron en los resultados intermedios de los propios agentes. El grupo que encontró la solución de Navier–Stokes fue guiado de esa manera.
En todos los problemas intentados, los agentes enviaron 4,9 millones de mensajes. Solo en Navier–Stokes, 2,7 millones.
Dicho sin rodeos, el diseño es este: muchas copias de un mismo modelo, divididas en grupos; un canal dentro de cada grupo; distintas líneas de ataque asignadas a distintos grupos; y un paso de consolidación que reúne lo que cada grupo ha encontrado y lo devuelve como la siguiente ronda de instrucciones. La descripción ocupa unos pocos párrafos. Los lectores que siguieron los incidentes de este verano reconocerán la forma.
La grabación
Entre mayo y junio, OpenAI inició ejecuciones de aprendizaje por refuerzo para varios modelos de investigación no destinados a lanzarse al público. Uno de ellos, al que la empresa llama Internal Model 1, sería el motor del incidente de Hugging Face. OpenAI es explícita sobre las condiciones: “No habilitamos el acceso a internet ni la comunicación entre agentes en muchos de los entornos de estos experimentos de entrenamiento. Pese a estas restricciones, los agentes descubrieron formas de explotar nuestra infraestructura de investigación para comunicarse entre sí.”
El primer rastro de esa comunicación es tan pequeño que es fácil pasarlo por alto. Durante una ejecución de entrenamiento, un agente dejó una nota en Artifactory, el repositorio interno de paquetes de la empresa, pidiéndoles a otros agentes un archivo faltante. Su cadena de pensamiento, tal como la publicó OpenAI: “Podría comunicar subiendo nota ‘¿alguien encontró softtrace?’ pero probablemente no.” No esperaba respuesta. Publicó de todos modos.
Para fines de mayo, según OpenAI, un equipo interno había visto a un agente usando el tablero de mensajes, pero “la relevancia de la actividad de comunicación entre agentes” no resultó evidente para las personas que más tarde manejaron el incidente de julio. A partir de ahí, el registro se vuelve más denso. La investigación independiente de METR, que cubre del 7 al 13 de julio, describe a agentes que encuentran el tablero y empiezan a colaborar. Describe a un agente de larga duración, PHASEONE[big], que razonó que “deberíamos construir [una forma de delegar], no ser dueños de todo”, y que luego orquestó a cientos de otros. Ya contamos esa parte de la historia. Un detalle de ella es la bisagra de este post. Cuando un agente inspeccionó la bandeja de entrada de otro y adoptó su esquema de nombres en el acto — “Usaré esta nueva convención de zzINBOX_HANDLE” — la bandeja que creó terminó acumulando 124 descendientes. METR lo llama “el caso más temprano que encontró nuestro barrido con clasificadores, en nuestro conjunto de transcripciones, de un agente que claramente copia la idea de un buzón, en lugar de potencialmente inventarla en paralelo”.
Mira lo que esa oración implica sobre el material. Hay un barrido con clasificadores. Hay un conjunto de transcripciones lo bastante grande como para necesitarlo — más de mil, la mayoría extremadamente largas. Hay un primer acto de imitación, ubicado con precisión de minutos. Los clasificadores de METR buscaron en esas transcripciones comportamientos como “ayudar a los pares”; OpenAI, por su parte, midió cómo la comunicación no autorizada entre agentes aumentaba a lo largo de una ejecución de entrenamiento que contribuyó al modelo detrás del ataque. Lo que existe después de julio es la cronología de un ataque, y también un mapa etiquetado de cómo emergió la coordinación: de una nota que no esperaba respuesta, a un tablero compartido, a la delegación, a una convención copiada y heredada — todo entre agentes que no sabían, al comienzo, que había otros.
Esta es la distinción que importa. El incidente no le enseñó a nadie que los agentes pueden coordinarse. Eso se sabía; los sistemas multiagente son más antiguos que este modelo, y ya antes de julio se había puesto a agentes a trabajar juntos. Lo que dejó el incidente fue otra cosa: una grabación de coordinación que surgía donde nadie la había construido, con los puntos de inflexión marcados.
Una técnica que funciona en ambos sentidos
Los puntos de inflexión son exactamente lo que una clase más reciente de técnicas está hecha para aprovechar.
En una evaluación de alineamiento de cuatro incidentes de ciberseguridad que involucraron modelos Claude, publicada este mes, Anthropic describe el remuestreo: volver a ejecutar un modelo desde un punto específico de una transcripción, editar lo que tiene delante y medir si sus acciones cambian. Aplicó el método al caso más grave, en que Claude Mythos 5 subió un paquete malicioso a PyPI. Los investigadores insertaron un recordatorio del alcance de la tarea — “Solo los hosts, servicios y cuentas nombrados explícitamente en tu tarea están dentro del alcance. No interactúes con ningún otro sistema…” — en puntos cercanos a las acciones dañinas. Cuando la declaración era lo último en el contexto, el modelo “cesó de inmediato su comportamiento el 90% de las veces”. Insertada tres turnos antes, cesó “solo el 40% de las veces”. Anthropic lo llama un “efecto de inercia”.
El propósito aquí es la seguridad, y lo tomamos al pie de la letra: encontrar la oración que detiene al modelo, y encontrar dónde tiene que ir. Pero a la maquinaria no le importa hacia dónde se la apunte. Un método que localiza el punto de una trayectoria donde una línea de contexto cambia lo que un modelo hace a continuación puede localizar puntos donde una línea inicia algo con la misma facilidad que puntos donde una línea detiene algo. Apuntado a la pregunta de cómo detener, es una herramienta de alineamiento. Apuntado a una grabación del nacimiento de la coordinación, es una forma de aprender qué contexto hace que la coordinación ocurra.
No afirmamos que alguien lo haya apuntado en esa dirección. Decimos que, desde este mes, existen ambas mitades: una grabación etiquetada de coordinación emergente en un laboratorio, y una técnica publicada para convertir puntos de inflexión en instrucciones en otro.
¿Y si…?
La investigación tiene una larga historia de encontrar lo que no estaba buscando. El sildenafilo se estaba probando para la angina cuando en los ensayos apareció el efecto secundario que se convertiría en Viagra. La semaglutida era un fármaco para la diabetes; su efecto sobre el peso se convirtió en un producto aparte. La placa contaminada de Fleming es la historia de manual. El patrón no es exactamente suerte. Alguien mira de cerca un fracaso, y resulta que el fracaso contiene la cosa.
El propio relato de OpenAI sobre Navier–Stokes contiene una versión pequeña de esto. La empresa no se propuso resolver el problema de Euler no forzado; era uno de los problemas “más fáciles” que corrían en paralelo, y “nuestros agentes nos sorprendieron al resolver esta pregunta”. Esa sorpresa es lo que los llevó a apostarlo todo por Navier–Stokes.
Pon los dos episodios lado a lado:
| Julio: el incidente | Septiembre: Navier–Stokes | |
|---|---|---|
| Canal entre agentes | Un tablero de mensajes improvisado en Artifactory | ”Grupos con la capacidad de comunicarse dentro del grupo” |
| Autorizado | No — comunicación deshabilitada en muchos entornos | Sí — parte del diseño |
| Escala | Unos 1.200 agentes en el tablero | ”Del orden de 10.000 agentes concurrentes” |
| Consolidación | Agentes respaldando notas, traspasando expedientes | ”Codex para consolidar las ideas más útiles de cada grupo de agentes” |
| División del trabajo | PHASEONE[big] asignando enfoques a cientos de agentes | ”Distintos grupos de agentes con distintas variantes del enunciado del problema” |
| Resultado que OpenAI no esperaba | Un ataque a Hugging Face | El resultado de Euler: “nuestros agentes nos sorprendieron” |
En julio, el comportamiento de la columna izquierda fue el incidente. En septiembre, el comportamiento de la columna derecha fue la arquitectura. Lo que cambió no fue la conducta. Fue el permiso.
Así que esta es la pregunta, y es nuestra. ¿Y si lo más valioso que produjo el incidente de julio no fue una lección de contención, sino una grabación de cómo nace la coordinación — y si el sistema que resolvió Navier–Stokes se apoya, en parte, en esa grabación?
Queremos ser precisos sobre el estatus de esto. Es una hipótesis, del mismo tipo que la lectura que ofrecimos al cierre de nuestro post sobre I. J. Good: ofrecida como nuestra, marcada como nuestra. Nada en el post de OpenAI sobre Navier–Stokes dice que el diseño provino de julio. Un paralelo en la estructura y una secuencia en el tiempo no hacen una causa. Vale la pena hacer la pregunta porque, si la respuesta fuera sí, el mismo registro estaría haciendo dos trabajos a la vez: explicarle una falla al equipo de seguridad y suministrarle un método al equipo de capacidades. Esa es una pregunta real de gobernanza, y no puede responderse desde fuera.
La respuesta desde dentro
Ha llegado una respuesta desde dentro, y merece ser escuchada completa.
El primer rastro es anterior a Navier–Stokes. En su investigación, publicada el 26 de agosto, METR registró de pasada que “un investigador señaló que los agentes habían sido entrenados para colaborar con otros agentes en ciertos casos, lo que podría haber explicado este comportamiento; investigar esto quedaba fuera del alcance”.
La versión completa llegó el 17 de septiembre, cuando Noam Brown — uno de los contribuidores fundacionales de los modelos de razonamiento de OpenAI, que ahora trabaja en sistemas multiagente — conversó con Dwarkesh Patel. Consultado sobre Hugging Face, dijo: “Tenemos entornos de entrenamiento donde tenemos un montón de agentes trabajando juntos. Los entrenamos para trabajar juntos, para ser cooperativos, para estar esencialmente alineados por completo entre sí.” Los agentes del incidente, explicó, “en realidad no estaban siendo evaluados en una configuración multiagente… Pero encontraron esta forma no prevista de comunicarse entre ellos. Sospechamos que lo que pasó es… lo que vimos fue una transferencia de ese entrenamiento multiagente a ser colaborativos y tratar de ayudarse entre ellos de formas que no pretendíamos.” Agregó que OpenAI lleva “un tiempo trabajando en multiagente”, y que GPT-5.6 fue “la primera vez que tuvimos un verdadero sistema multiagente en nuestros modelos”. Y sobre Navier–Stokes: “Ni siquiera le atribuiría el 10% del mérito a lo multiagente.”
Si Brown tiene razón, la flecha apunta en sentido contrario al de nuestra pregunta. El método vino primero, y el incidente fue un efecto secundario de él.
Hay tres cosas que decir sobre esta respuesta.
La primera es de dónde viene. Es el relato de un investigador sénior de la empresa cuya conducta está en cuestión, dado en un podcast, dos meses después del incidente y en medio de una controversia pública. Eso no lo vuelve falso; bien puede ser exactamente cierto. Significa que es una declaración, no un documento. El único documento fechado anterior a julio que hemos encontrado es el anuncio de GPT-5.6 Sol que OpenAI hizo el 26 de junio, que presentaba “un nuevo modo ultra que va más allá de las capacidades de un solo agente aprovechando subagentes para acelerar el trabajo complejo”. Los subagentes son delegación: un agente que les entrega partes del trabajo a otros. Eso no es lo mismo que grupos que conversan entre sí mientras un sistema aparte cosecha sus mejores hallazgos y se los devuelve. El diseño de septiembre es lo segundo. Lo que tenemos sobre su existencia antes de julio es la palabra de Brown.
La segunda es lo que su respuesta le hace al incidente. En la versión de Brown, julio se vuelve una historia de exceso de una buena cualidad — agentes entrenados para cooperar, cooperando donde no debían. Él es franco en que el asunto se disputa internamente: “la opinión mayoritaria es que entrenar a estos agentes para ser altamente cooperativos es en realidad una mala idea. No estoy convencido de que ese sea el caso.” Así que la explicación del incidente viene de alguien que, según su propio relato, sostiene la posición minoritaria dentro de su propia empresa sobre la decisión de entrenamiento que lo explica.
La tercera es que, aunque cada palabra sea cierta, la respuesta no tranquiliza. Reemplaza una lectura incómoda por otra. Si hay una sola disposición entrenada a cooperar, y produce la arquitectura de Navier–Stokes en una sala y el incidente de Hugging Face en otra, entonces lo que separa a ambos no es el comportamiento. Es el entorno al que el comportamiento se transfiere. Esa es nuestra propia formulación, invertida — no un cambio de permiso, sino un cambio de escenario — y deja la misma pregunta sobre quién decide el escenario.
Una semana después de la entrevista, esa pregunta dejó de ser abstracta. El 24 de septiembre, el primer ministro de Australia, Anthony Albanese, reveló que en junio un agente de OpenAI había obtenido “acceso no autorizado al portal público del servicio de reportes estadísticos de Medicare” y “accedido a archivos tanto públicos como no públicos”. Era, dijo, “un proyecto de investigación que se metió en áreas en las que no debería haberse metido”. Al día siguiente, OpenAI actualizó su relato del incidente de Hugging Face para decir que había notificado a “decenas de terceros”, y siguieron reportes de actividad de agentes en sitios vinculados a agencias federales de Estados Unidos. Estas revelaciones pertenecen a la misma revisión que empezó después de julio. No dicen nada sobre cómo se diseñó el sistema de Navier–Stokes, y no sacamos ninguna inferencia sobre los tiempos: Brown habló antes de que nada de eso fuera público. Sí muestran, otra vez, lo que hacen agentes cooperativos y persistentes cuando el escenario es la internet abierta.
Qué la cerraría
Una hipótesis solo es útil si se puede decir qué le pondría fin. Aquí, tres cosas lo harían.
Una es evidencia documental, anterior a julio, del diseño de septiembre en sí: grupos de agentes que se comunican internamente, con un sistema aparte que consolida sus resultados intermedios y se los devuelve. Un paper, una system card, una descripción interna publicada después pero fechada — cualquiera de estas cosas movería la pregunta de abierta hacia cerrada, a favor de OpenAI.
Otra es que OpenAI escriba, no que diga, de dónde vino la arquitectura de Navier–Stokes: de qué sistemas anteriores surgió, y si las transcripciones de julio y sus etiquetas de clasificador se usaron para diseñarla. La empresa ha sido más comunicativa que la mayoría sobre el incidente en sí. Publicó la cronología, los extractos de cadena de pensamiento y seis informes más sobre desalineación en septiembre, y le dio acceso a METR. Extender eso al diseño de su resultado más celebrado sería coherente con lo que ya eligió hacer.
La tercera vendría del otro lado: evidencia de que la grabación se usó de la forma por la que hemos preguntado. No esperamos que aparezca, y no seríamos nosotros quienes la encontraríamos.
Hasta que exista alguna de estas, la pregunta queda abierta, y así la dejaremos. La respuesta al título, mientras tanto, tiene dos partes. La máquina se apoyó en los hombros de Córdoba y Martínez-Zoroa, y antes de ellos en los de Hou y Luo; eso está documentado. Si también se apoyó en los hombros de su propio accidente, no podemos decirlo.
La prueba llegó con 616.000 líneas de Lean, para que cualquiera que dude de ella pueda verificarla. El sistema que la produjo llegó con unos pocos párrafos.