Un equipo de especialistas de la firma Hacktron AI logró comprometer cuentas de empleados de OpenAI y alcanzar sus repositorios internos de software en GitHub mediante una cadena de ataques asistida por la inteligencia artificial de su rival comercial, el modelo Claude desarrollado por Anthropic.
La demostración de seguridad, concretada el 25 de julio de 2026, puso de manifiesto cómo las herramientas avanzadas de IA reducen radicalmente los plazos para transformar fallas de software en vectores de ataque plenamente funcionales, logrando completar el proceso en menos de 72 horas.
Para acceder a la infraestructura interna, los investigadores articularon dos vulnerabilidades independientes: un fallo en el procesamiento de imágenes dentro del foro oficial de la compañía y una brecha en su sistema de autenticación única (SSO).
En el proceso, la IA de Anthropic actuó como un copiloto técnico clave:
«Los especialistas emplearon una versión de Claude Opus para auditar componentes de software e identificar fallos en la biblioteca de procesamiento de imágenes, utilizando posteriormente modelos más recientes de la misma familia para desarrollar y adaptar el código de explotación a diversos entornos», detalló el informe de Hacktron AI.
- Intervención humana: Pese al apoyo de la IA en la aceleración del análisis, los expertos precisaron que la ejecución requirió supervisión y criterios técnicos de especialistas humanos.
- Acceso a repositorios: Tras tomar el control de la cuenta de un colaborador, el equipo accedió a la herramienta Codex conectada a la organización de OpenAI en GitHub. Para validar la intrusión sin comprometer datos sensibles, abrieron una solicitud de cambios (pull request) de prueba dentro de un repositorio privado.
Tras verificar el alcance del acceso, los auditores detuvieron las pruebas y notificaron de inmediato a OpenAI y a Discourse, la plataforma externa sobre la cual opera el foro corporativo.
Según la cronología divulgada por los investigadores, OpenAI corrigió la vulnerabilidad en un lapso aproximado de 14 horas tras recibir la alerta. Por la identificación de la falla y su reporte ético, la compañía otorgó a la firma una recompensa de 6.500 dólares en el marco de su programa de hallazgos.
Con información de Heraldo
