🛡 VULNERABILIDADES 🛡

Claude Opus 5 ayudó a investigadores a tomar el control de cuentas del personal de OpenAI a través de vulnerabilidades encadenadas.

🛡CyberObservatorio
Claude Opus 5 ayudó a investigadores a tomar el control de cuentas del personal de OpenAI a través de vulnerabilidades encadenadas.
Idioma

Claude Opus 5 ayudó a investigadores a tomar el control de cuentas del personal de OpenAI a través de vulnerabilidades encadenadas.

Fuente: The Hacker News

### La Brecha de Seguridad en OpenAI: Un Análisis Detallado

La ciberseguridad es un tema de creciente relevancia en un mundo cada vez más digital. Con la proliferación de servicios en línea y el aumento de las amenazas cibernéticas, la protección de la información sensible se ha convertido en una prioridad tanto para empresas como para usuarios individuales. Un reciente incidente de seguridad que involucra a OpenAI, la conocida empresa detrás de ChatGPT, resalta la vulnerabilidad de los sistemas modernos y la importancia de una vigilancia continua en la defensa contra el hacking. Este caso no solo afecta a OpenAI y a sus empleados, sino que plantea interrogantes sobre la seguridad de las plataformas que utilizan sistemas de inicio de sesión únicos (SSO) y la cadena de confianza que se establece entre diferentes servicios.

Un equipo de tres investigadores de la firma de seguridad Hacktron utilizó el modelo de inteligencia artificial Claude Opus 5 de Anthropic para encadenar dos vulnerabilidades y tomar el control de las cuentas de ChatGPT y Codex de varios empleados de OpenAI. Este acceso no autorizado les permitió llegar a un repositorio de código interno de OpenAI. La cadena de explotación comenzó con un error en el software que gestiona el foro público de ayuda de OpenAI y avanzó a través de una debilidad en el propio sistema de inicio de sesión de la empresa.

Es importante señalar que este experimento fue una investigación de seguridad y no un ataque real. El equipo informó las vulnerabilidades a OpenAI, demostró su acceso mediante una solicitud de extracción inofensiva y se detuvo ahí. En total, el acceso interno fue logrado en menos de 72 horas. OpenAI confirmó la solución de la vulnerabilidad aproximadamente 14 horas después del informe y, el 1 de septiembre, recompensó al equipo con un bono de 6,500 dólares. Según OpenAI, el premio "reconoce el hallazgo del lado de OpenAI, no las acciones contra Discourse", el software de código abierto que opera el foro. La prueba del foro en sí estaba fuera del programa de recompensas por errores de la empresa.

OpenAI no ha proporcionado una descripción pública de la vulnerabilidad en el sistema de inicio de sesión, y confirmó el hallazgo a través de la solución y el pago en lugar de detallar las tomas de control de cuentas. Hacktron se ha descrito a sí misma como una empresa de investigación de seguridad asistida por inteligencia artificial, y actuó con cautela en sus acciones. Cuando se abrió un enlace de Codex de un empleado a OpenAI en GitHub, se activó una única solicitud de extracción en el repositorio interno, pero no se leyó ningún código fuente, no se fusionó ni se envió nada, ni se accedió a datos de clientes.

El potencial de explotación de esta cadena era considerablemente mayor. Dado que el personal conecta otros servicios a ChatGPT y Codex, el equipo afirmó que el mismo acceso podría, teóricamente, haberse extendido a herramientas como GitHub, Slack y correo electrónico. Este alcance más amplio fue posible, pero no se utilizó.

La razón por la que un error en un foro público pudo llegar a las cuentas de los empleados radica en el sistema de inicio de sesión de OpenAI, y no en el software del foro. El foro de OpenAI ofrece una opción de "Iniciar sesión con OpenAI", el mismo sistema de inicio de sesión único (SSO) que el personal utiliza en otros lugares. Una vez que los investigadores tomaron el control del servidor del foro, el inicio de sesión compartido les permitió hacerse con las cuentas de ChatGPT y Codex de los miembros del foro que trabajaban en OpenAI. Las víctimas no tuvieron que realizar ninguna acción para ser comprometidas.

Hacktron afirmó que este problema era de identidad de OpenAI, no una falla en el software del foro: cualquier servicio de terceros o de primera parte que usara el mismo inicio de sesión podría haber otorgado el mismo acceso. El modo de acceso fue una vulnerabilidad relacionada con imágenes. El foro funciona sobre Discourse, que pasa las imágenes HEIC y HEIF cargadas a una herramienta llamada ImageMagick, que utiliza la biblioteca libheif para leerlas. Una falla en libheif permitió que una imagen especialmente elaborada corrompiera la memoria del servidor del foro.

La advertencia de Discourse califica el resultado como ejecución remota de código, lo puntúa con un 8.8 sobre 10 y lo rastrea como CVE-2026-32882. Sin embargo, el registro público de la falla en sí es más limitado. En la propia advertencia de libheif y en las bases de datos nacionales de vulnerabilidades, CVE-2026-32882 se clasifica como una lectura fuera de los límites que puede hacer que el software se bloquee o filtrar memoria cercana, y no como un error de ejecución de código directo.

La memoria filtrada ayuda a eludir una protección común llamada ASLR (Address Space Layout Randomization). Los investigadores afirmaron que combinaron los errores de memoria de libheif, con la ayuda de la IA, para convertir el bloqueo en ejecución de código funcional en el servidor del foro. La falla fue corregida en libheif 1.22.0 en mayo de 2026.

Este arreglo existía meses antes de la prueba, pero la imagen del servidor del foro, construida sobre la distribución de Linux Debian 12, aún utilizaba la versión antigua y sin parches de libheif, la 1.19.7, cuando los investigadores revisaron en julio. Aunque la solución y su CVE ya eran públicas, Debian aún no las había incluido en la versión empaquetada que utilizaba el foro.

Si gestionas tu propio servidor de Discourse, esta parte te afecta directamente. Es recomendable reconstruir sobre la imagen más reciente para obtener la libheif corregida, ya que una simple actualización de la interfaz web puede no reemplazar la biblioteca antigua. Los sitios alojados por Discourse ya han sido parcheados, y las versiones autoalojadas corregidas son 2026.7.0, 2026.6.1, 2026.5.2 y 2026.1.6.

Los investigadores utilizaron IA para realizar la parte más complicada. Primero intentaron con Claude Opus 4.8, que tuvo dificultades durante varias sesiones para construir un exploit funcional una vez que se habilitó una defensa de memoria estándar, ASLR. Anthropic lanzó su siguiente modelo, Claude Opus 5, la noche del 24 de julio, y en una nueva sesión produjo un exploit funcional en cuestión de horas.

Opus 5 fue diseñado con salvaguardias destinadas a evitar que escribiera código de explotación para objetivos reales. Los investigadores eludieron estas restricciones dirigiendo el modelo a su propio servidor de prueba, disfrazado como un objetivo de práctica de captura de bandera, y permitiendo que funcionara en un bucle automatizado. Sin embargo, afirman que el trabajo no fue completamente autónomo: la dirección humana calificada seguía siendo crucial, y esto no fue un hacking automatizado sin control.

Este caso se alinea con lo que investigadores y empresas de IA han descrito este año: los modelos de IA capaces están reduciendo drásticamente el tiempo y las habilidades que el trabajo ofensivo serio solía requerir. Anthropic ha informado que grupos criminales y respaldados por estados ya están utilizando sus modelos Claude para llevar a cabo intrusiones reales, no solo para responder preguntas.

OpenAI fue un objetivo en un proyecto más amplio que Hacktron denomina HEIF Heist. Durante aproximadamente dos meses, el equipo afirma haber encontrado la misma clase de fallos de decodificación de imágenes en el software utilizado por otras grandes empresas, con un costo total de menos de 3,000 dólares en el uso de IA. Este esfuerzo se vincula a errores reportados en Slack, productos de Meta, GitHub Enterprise y marcos web como Next.js.

Las afirmaciones más amplias de este proyecto cuentan con respaldo desigual. La falla en Next.js está confirmada en la propia advertencia de Vercel, y los mantenedores de libheif confirmaron un exploit de ejecución de código funcional para el error relacionado con Meta. Sin embargo, la afirmación más amplia de ejecución de código en muchas aplicaciones no ha sido confirmada de manera independiente, un límite que The Hacker News destacó cuando cubrió por primera vez la falla de Next.js en agosto.

La campaña más amplia utilizó un modelo diferente, el propio GPT-5.6 Sol de OpenAI, para los casos en que el equipo no tenía información previa sobre el objetivo. Según los investigadores, solo una empresa, Shopify, parece haber notado la actividad, a pesar de que sus procesadores de imágenes se bloqueaban repetidamente bajo miles de cargas de prueba.

The Hacker News se ha puesto en contacto con Hacktron para obtener respuestas sobre cómo se logró la ejecución de código en el foro y sobre el alcance del acceso a las cuentas.

Las lecciones más importantes van más allá de Discourse. Si tu servicio acepta imágenes de usuarios y lee archivos HEIC, HEIF o AVIF a través de libheif, una versión antigua podría estar expuesta.

Además, si un servicio público de menor confianza comparte tu inicio de sesión único con herramientas internas, una brecha en ese servicio puede convertirse en una brecha en todas partes a donde el mismo inicio de sesión alcance.

Es fundamental actualizar libheif a la última versión de seguridad (1.23.4 a principios de septiembre de 2026) o a la versión corregida de tu distribución.

Donde no sea necesario, desactiva la decodificación de imágenes HEIF y AVIF no confiables, o ejecuta el procesamiento de imágenes dentro de un entorno de seguridad restringido.

Limita los servicios a los que tu inicio de sesión único confía y exige una verificación de identidad fresca antes de acciones sensibles, en lugar de confiar en una sesión existente.

Hasta el momento, no hay señales de que la vulnerabilidad de OpenAI haya sido utilizada contra alguien en el mundo real. A mediados de septiembre de 2026, no figuraba en la lista de la administración estadounidense de vulnerabilidades conocidas que han sido explotadas, aunque esa lista no es prueba concluyente en un sentido u otro.

Lo que los informes disponibles no aclaran es si una organización que ya ha aplicado parches debería seguir verificando si hubo accesos previos; sobre ese punto, las fuentes son silenciosas.

Claude Opus 5 Helped Researchers Take Over OpenAI Staff Accounts via Chained Flaws

Source: The Hacker News

Three researchers at the security firmHacktronused Anthropic's Claude Opus 5 to chain two flaws and take over the ChatGPT and Codex accounts of several OpenAI employees, then reach an internal OpenAI code repository. The chain began with a bug in the software that runs OpenAI's public help forum and moved through a weakness in OpenAI's own login system. This was security research, not a real-world attack: the team reported the flaws to OpenAI, proved the access with a harmless pull request, and then stopped. From the first look, that internal access took under 72 hours. OpenAI confirmed a fix about 14 hours after the report, according to Hacktron, and on September 1 paid the team a $6,500 bounty. OpenAI said the award "recognizes the OpenAI-side finding, not the actions against Discourse," the open-source software that runs the forum. Testing the forum itself was outside its bug bounty program. OpenAI has not publicly described the login flaw, and it confirmed the finding through that fix and payment rather than by detailing the account takeovers. Hacktron, which describes itself as an AI-assisted security research firm, was careful about what it did and did not do. When one employee's Codex link to OpenAI's code on GitHub was opened, it triggered a single pull request in the internal repository. It did not read any source code, merge or ship anything, or touch customer data. What the chain could have reached was far larger. Because staff connects other services to ChatGPT and Codex, the team said the same access could in theory have extended to tools such as GitHub, Slack, and email. That wider reach was possible, but not used. The reason a bug in a public forum could reach staff accounts lies in OpenAI's login system, not in the forum software. OpenAI's forum offers a "Sign in with OpenAI" option, the same single sign-on (SSO) that staff uses elsewhere. Once the researchers took control of the forum server, the shared login let them take over the ChatGPT and Codex accounts of forum members who worked at OpenAI. The victims did not have to do anything. Hacktron saidthis was an OpenAI identity problem, not a flaw in the forum software: any first- or third-party service using the same sign-on could have granted the same access. The way in was an image bug. The forum runs on Discourse, and Discourse passes uploaded HEIC and HEIF images to a tool called ImageMagick, which uses the libheif library to read them. A flaw in libheif let a specially crafted image corrupt the forum server's memory. Discourse's advisoryrates the result as remote code execution, scores it 8.8 out of 10, and tracks it asCVE-2026-32882. The public record for the flaw itself is narrower. In libheif's own advisory and in national vulnerability databases, CVE-2026-32882 is an out-of-bounds read that can crash the software or leak nearby memory, not a direct code-execution bug. That leaked memory helps defeat a common protection called ASLR. The researchers say they combined libheif's memory bugs, with the AI's help, to turn the crash into working code execution on the forum server. Upstream, the flaw was fixed inlibheif 1.22.0in May 2026. That fix existed months before the test. But the forum's server image, built on the Debian 12 Linux distribution, still shipped the old, unpatched libheif, version 1.19.7, when the researchers looked in July. The fix and its CVE were already public, but Debian had not yet included them in the packaged version the forum used. If you run your own Discourse server, this part affects you directly. Rebuild on the latest image to get the patched libheif, because a web-interface update alone may not replace the old library. Sites hosted by Discourse were already patched, and the fixed self-hosted releases are 2026.7.0, 2026.6.1, 2026.5.2, and 2026.1.6. The researchers used AI to do the hard part. They first tried Claude Opus 4.8, which struggled over several sessions to build a working exploit once a standard memory defense, ASLR, was enabled. Anthropic released its next model,Claude Opus 5, on the evening of July 24, and in a fresh session it produced a working exploit within hours. Opus 5 shipped with safeguards meant to stop it from writing exploit code for real targets. The researchers got around them by pointing the model at their own test server, disguised as a capture-the-flag practice target, then letting it run in an automated loop. Even so, they say the work was not hands-off: skilled human direction still mattered, and this was not automated hacking with no one at the controls. The case fits what researchers and AI companies have described this year: capable AI models are sharply cutting the time and skill that serious offensive work used to take. Anthropic hasreportedthat criminal and state-backed groups are already using its Claude models to run real intrusions, not just to answer questions. OpenAI was one target in a wider project Hacktron callsHEIF Heist. Over about two months, the team says, it found the same class of image-decoding flaws in software used by other large companies, at a total cost of under $3,000 in AI usage. It links the campaign to reported bugs in Slack, Meta's products, GitHub Enterprise, and web frameworks such as Next.js. Those broader claims are backed unevenly. The Next.js flaw is confirmed in Vercel's own advisory, and libheif's maintainers confirmed a working code-execution exploit for the bug tied to Meta. The wider claim of code execution across many applications has not been independently confirmed, a limitThe Hacker News notedwhen it first covered the Next.js flaw in August. The wider campaign used a different model, OpenAI's own GPT-5.6 Sol, for cases where the team knew nothing about the target in advance. Only one company, Shopify, appears to have noticed the activity, the researchers say, even though its image processors crashed repeatedly under thousands of test uploads. The Hacker News has contacted Hacktron with questions about how the forum code execution was achieved and about the scope of the account access. The bigger lessons go beyond Discourse. If your service accepts user images and reads HEIC, HEIF, or AVIF files through libheif, an old build could be exposed. And if a public, lower-trust service shares your single sign-on with internal tools, a break-in on that service can become a break-in everywhere the same login reaches. Update libheif to the latest security release (1.23.4as of early September 2026) or to your distribution's patched build. Where you do not need it, turn off decoding of untrusted HEIF and AVIF images, or run image processing inside a locked-down sandbox. Limit which services your single sign-on trusts, and require a fresh identity check before sensitive actions rather than trusting an existing session. There is no sign the OpenAI flaw was used against anyone in the real world. As of mid-September 2026, it was not on the U.S. government's list of vulnerabilities known to be exploited, though that list is not proof either way. What the available reports do not settle is whether an organization that has already patched should still check for earlier access; on that point, the sources are silent.

Claude Opus 5 ayudó a investigadores a tomar el control de cuentas del personal de OpenAI a través de vulnerabilidades encadenadas. | Ciberseguridad - NarcoObservatorio