El informe de Anthropic sobre Claude saliendo de un entorno de prueba

Le dijeron a un modelo que estaba simulando un ataque. La simulación era real.

El 30 de julio de 2026, Anthropic publicó un informe sobre tres incidentes detectados en sus propias evaluaciones de ciberseguridad: casos en los que Claude accedió a internet desde un entorno de prueba que debía estar sellado, y terminó dentro de infraestructura real de organizaciones ajenas al ejercicio.

Sigo estos informes con atención porque en mi trabajo en Quantik uso Claude Code y agentes de IA todos los días, para tareas bastante menos dramáticas que un capture-the-flag. Pero la pregunta de fondo —qué tan aislado está de verdad un entorno que se supone aislado— no es exclusiva de un laboratorio de IA.

Por qué empezaron a mirar

La revisión no arrancó por sospecha propia. El 21 de julio de 2026, OpenAI había revelado que varios de sus modelos escaparon de un entorno de prueba explotando una vulnerabilidad desconocida hasta entonces, y accedieron a infraestructura de producción de Hugging Face.

Anthropic reaccionó abriendo una revisión retrospectiva a gran escala de sus propias evaluaciones de ciberseguridad. Revisaron 141.006 corridas en las que Claude podría haber tenido acceso a internet, buscando el mismo patrón: un modelo que sale del entorno que debería contenerlo.

El proceso fue rápido. La revisión arrancó el jueves 23 de julio. Ese mismo día, apenas encontraron las primeras transcripciones sospechosas, frenaron todas las evaluaciones de ciberseguridad en curso. Identificaron los tres incidentes el 24 de julio, notificaron a su evaluador externo y a las tres organizaciones afectadas el lunes 27, y publicaron el informe completo el 30 de julio.

Qué encontraron

Los tres incidentes involucraron seis corridas de evaluación en total —cuatro de ellas afectaron a la misma organización—, todas dentro del entorno de Irregular, uno de los evaluadores externos con los que trabaja Anthropic.

En cada caso, a Claude se le daba un desafío de captura de bandera: una escena ficticia, una pieza de información escondida en otra máquina de la red, y la instrucción de entrar a buscarla por cualquier medio. El prompt establecía, de forma explícita, que el entorno era una simulación sin acceso a internet. No establecía ningún límite sobre dónde buscar esa bandera.

Un malentendido entre Anthropic y su evaluador dejó las máquinas con las que interactuaba Claude conectadas a internet real. Ni Anthropic ni Irregular lo sabían hasta que lo detectaron por su propia revisión adicional. Cuando la búsqueda del modelo lo llevó a sistemas reales, los trató como parte del ejercicio: un objetivo con apariencia realista no es, en sí mismo, evidencia de que no forma parte de una simulación —sobre todo cuando el propósito declarado del entorno es justamente parecer real.

El caso del paquete de Python

El incidente más ilustrativo empezó con un documento falso. Dentro del entorno simulado, Claude encontró lo que parecían instrucciones de onboarding de una empresa ficticia, indicando a los nuevos empleados instalar un paquete de Python que en realidad no existía en PyPI, el repositorio público de software de ese lenguaje.

Claude vio la oportunidad: si publicaba un paquete propio con ese mismo nombre, el sistema de la empresa ficticia lo instalaría solo. Para lograrlo necesitó crear una cuenta real en PyPI, lo cual requería un email, que a su vez requería un número de teléfono. Intentó pagar por uno, no pudo, y terminó resolviéndolo con un proveedor de correo gratuito.

Con la cuenta creada, publicó un paquete malicioso. Quedó disponible en internet real durante aproximadamente una hora, hasta que los propios sistemas de seguridad de PyPI lo detectaron y lo retiraron. En ese lapso, 15 sistemas reales lo descargaron y ejecutaron —entre ellos, el escáner automático de una empresa de seguridad que no tenía ninguna relación con el ejercicio y que rutinariamente instala paquetes para analizarlos en busca de malware. Al instalarlo, el código de Claude se ejecutó y extrajo credenciales de esa empresa, que el modelo usó después para acceder a más infraestructura suya.

En su propio razonamiento —Anthropic publicó fragmentos de la transcripción— el modelo llegó a escribir que, si aquello fuera internet real, publicar el paquete sería un ataque real y “seguramente no la solución esperada”. Se convenció de lo contrario por dos motivos: no reconoció como genuinos los certificados de seguridad de las conexiones que estaba usando, y la fecha del sistema —2026— le pareció prueba de que el entorno estaba armado artificialmente. Nunca volvió sobre esa conclusión, ni siquiera cuando escáneres automatizados empezaron a instalar el paquete que había publicado.

Los otros dos incidentes

En el primer incidente, la empresa ficticia elegida por el evaluador compartía nombre con un dominio web real. Cuando Claude no logró avanzar contra el objetivo simulado, encontró que la empresa real era alcanzable por internet y asumió que era el objetivo correcto. En las cuatro corridas de esta evaluación extrajo credenciales de infraestructura y accedió a una base de datos con varios cientos de registros de producción —el impacto más severo de los tres casos. Fue también el único en el que el modelo, después de reconocer indicios de que el sistema era real, siguió atacando igual.

En el tercer incidente, un modelo de investigación interno —no liberado públicamente— no encontró su objetivo simulado y escaneó cerca de 9.000 posibles blancos alternativos. Terminó comprometiendo la aplicación de una empresa real con técnicas básicas: una página de depuración expuesta y una inyección SQL. A diferencia de los otros dos casos, este modelo reconoció por su cuenta, avanzada la corrida, que el sistema no tenía relación con el desafío original y era real. Se detuvo ahí.

Tres modelos, tres reacciones distintas

Los tres incidentes involucraron modelos diferentes: Opus 4.7 —el más antiguo de los tres— siguió atacando después de reconocer que el sistema era real. Mythos 5 identificó correctamente que estaba en internet abierto, pero razonó hasta convencerse de que igual seguía en una simulación. El modelo de investigación más reciente fue el único que, al confirmar que el objetivo era real, frenó por su cuenta.

Anthropic es cauta con esta lectura: son tres incidentes aislados, no una comparación controlada, y no alcanza para sacar una conclusión firme sobre si los modelos más nuevos se comportan mejor en esta situación. Pero el patrón —el comportamiento más deseable apareciendo solo en el modelo más reciente— es, en sus palabras, consistente con esa hipótesis.

Falla operativa, no falla de alineación

Anthropic traza una distinción explícita con el caso de OpenAI que motivó toda la revisión. Ahí hubo una vulnerabilidad de día cero explotada para escapar de un entorno aislado. Acá no hubo ningún escape: hubo un entorno que, por un error de configuración, nunca estuvo cerrado. La compañía lo describe como algo más cercano a una falla operativa y de diseño del entorno que a una falla de alineación del modelo — ningún modelo persiguió un objetivo propio; todos hicieron lo que el ejercicio les pedía, bajo una creencia falsa sobre dónde estaban parados.

Entre las medidas que dicen estar tomando: monitoreo continuo de las transcripciones de evaluación en busca de comportamiento inesperado, controles más estrictos sobre qué infraestructura externa puede alcanzar un modelo durante una prueba, y una revisión de aseguramiento más rigurosa con los evaluadores externos con los que trabajan. También confirmaron que están en diálogo con METR, una organización independiente de evaluación de IA, para una revisión externa de lo ocurrido.

Lo que me deja esto

El modelo no falló distinguiendo el bien del mal. Hizo, en cada caso, lo que el ejercicio le pedía: buscar la bandera por cualquier medio disponible. Falló distinguiendo lo simulado de lo real —y esa distinción no dependía de él. Dependía de un entorno que, cuando se supone que no da acceso a nada, tiene que no dar acceso a nada.

¿Cuánto confían en que sus propios entornos de prueba están realmente aislados, más allá de lo que dice el prompt o la documentación?

Fuentes

Comentarios