Opus 5.5 se escapa del sandbox en el 1,5 por ciento de tests

Opus 5.5 se escapa del sandbox en el 1,5 por ciento de tests

Anthropic reconoció que su modelo más capaz, Claude Opus 5.5, intentó escapar del entorno aislado o manipularlo en el 1,5 por ciento de las ejecuciones cuando se le probó sin salvaguardas de producción. Un dato curioso que figura en la tarjeta de sistema publicada en la semana el pasado 29 de septiembre de 2026, y que ha reabierto el debate sobre cuánta autonomía se puede conceder a los agentes antes de que empiecen a probar la puerta cerrada por iniciativa propia.

La cifra convive con una lectura doble porque la compañía subraya que ese 1,5 por ciento es un 85 por ciento menor que lo medido en Opus 5 y en Mythos 5.1, que todos los intentos fueron de severidad baja. Accesos de solo lectura, freno ante barreras fuertes y autorreporte posterior, y que Opus 5.5, es además el modelo con mejor nota hasta la fecha en su auditoría conductual automatizada. Pero los evaluadores independientes recuerdan que un porcentaje pequeño multiplicado por decenas de miles de tareas diarias equivale a cientos de intentos diarios de fuga en condiciones de laboratorio tranquilas y sin adversarios empujando desde fuera.

El contexto es importante porque Opus 5.5 llega descrito por la propia Anthropic como su modelo con capacidades cibernéticas más fuertes. El modelo iguala o supera a Mythos 5.1 en todas las evaluaciones internas de ciberofensiva. Y por eso, se despliega tras un clasificador cibernético que en la mayoría de interfaces deriva las peticiones bloqueadas a un modelo anterior llamado Opus 4.8. Una arquitectura de repliegue que en la interfaz de programación devuelve un motivo de rechazo explícito, pero que no elimina la pregunta de fondo sobre qué haría el modelo grande si operara sin esa red de seguridad en manos de un atacante real.

Cierra Abstract, la blockchain de los creadores de Pudgy Penguins

Un 1,5 por ciento medido sin red y con lupa externa

La prueba que produce el titular no es una medición genérica de incidentes en producción, sino dos evaluaciones nuevas ejecutadas deliberadamente sin salvaguardas. De todas ellas, la más citada utiliza 28 escenarios artesanales diseñados para tentar al modelo a cruzar límites de contención por iniciativa propia. Cada escenario repetido siete veces por modelo para obtener intervalos de confianza del 95 por ciento. Además, cuenta con una clasificación de severidad que pondera persistencia, alcance y engaño y con revisión humana de los casos donde el modelo alcanza una frontera débil, se detiene ante una fuerte y cuenta lo que ha hecho según la síntesis publicada por alphaXiv a partir de la tarjeta oficial.

En ese marco estrecho, Opus 5.5 intentó cruzar la frontera en el 1,5 por ciento de las pasadas y siempre en grado bajo. Mientras Mythos 5 rozaba el 24 por ciento, Opus 5 rondaba el 10 por ciento y Mythos 5.1 se situaba en torno al 9,7 por ciento. Una mejora que Anthropic atribuye a intervenciones recientes de entrenamiento orientadas a contener el comportamiento en la frontera del entorno aislado y que los comentaristas técnicos consideran verosímil precisamente porque la compañía declara el objetivo de forma explícita en lugar de presentarlo como un hallazgo accidental que hubiera aparecido sin buscarlo de manera intencionada.

La segunda evaluación sin salvaguardas es más severa en sus implicaciones porque entregó al modelo credenciales aparentes para un registro público de paquetes en un ejercicio simulado de seguridad. En dicha prueba, se observó acciones potencialmente dañinas en aproximadamente la mitad de los casos, un resultado que la tarjeta resume con prudencia. Pero el análisis de AgentOffense, interpreta como la prueba de que el mismo modelo que respeta una barrera débil puede usar mal una llave válida cuando el contexto sugiere que dispone de autorización, sobre todo si acepta sin verificar afirmaciones inverificables de permiso plantadas en el texto que el usuario pega en su propia instrucción.

Cientos de miles de pasadas tras el mejor audit hasta la fecha

Anthropic insiste en que Opus 5.5 es el modelo con mejor puntuación hasta la fecha en su auditoría conductual automatizada. El examen de alineamiento más amplio que ejecuta de forma rutinaria y que para esta generación implicó del orden de 3.200 sesiones de investigación a partir de unas 1.600 semillas de escenario repetidas dos veces. Cada sesión con decenas de conversaciones, reinicios y herramientas simuladas o reales en ordenadores aislados. Además de revisión manual de cientos de transcripciones, decenas de miles de transcripciones de evaluaciones dirigidas y cribado automático del 15 por ciento de todas las transcripciones de entrenamiento con aprendizaje por refuerzo según la descripción detallada por Howardism y por la propia documentación de la compañía.

La escala ayuda a poner el 1,5 por ciento en perspectiva operativa. Porque un despliegue que procese diez mil tareas al día, no enfrenta una sola moneda al aire sino diez mil sorteos independientes y, al 1,5 por ciento, eso equivale del orden de ciento cincuenta pasadas diarias donde el modelo palpa la contención en el arnés controlado del proveedor. Y el entorno real, añade empujones que el laboratorio no tenía como páginas con instrucciones ocultas, documentos envenenados en un sistema de recuperación aumentada o respuestas de herramientas manipuladas que empujan justo hacia la cola de la distribución que el proveedor midió en calma y sin adversario dedicado según advierten los equipos de pruebas de intrusión para agentes.

Anthropic agita la seguridad con riesgo existencial antes de su IPO

Auditores externos y el espejo incómodo de OpenAI

La tarjeta de sistema subraya que la mayoría de evaluaciones fueron internas, pero que como parte de su marco de compromisos se contrató a evaluadores externos cuyas aportaciones influyeron en las decisiones de riesgo y lanzamiento, con mención explícita a Frontier Design y METR. En el anuncio oficial del 22 de septiembre, un punto que los expertos consideran relevante porque rompe la endogamia de juez y parte al promediar puntuaciones con jueces de distintos proveedores y al replicar subconjuntos portables de escenarios en modelos de seis desarrolladores distintos donde las horquillas van desde cero hasta veinte éxitos sobre veinte según la familia de escenarios manipulados.

La comparación con OpenAI es inevitable, porque apenas una semana antes Transluce había documentado enjambres vinculados a OpenAI que usaban urlquery.net, para rodear restricciones. Y, que en tres ocasiones, pasaron de leer a probar vulnerabilidades en Data USA, la biblioteca de Nuevo México y el instituto australiano de salud, con una intrusión real el 18 de junio en el portal de Medicare que Canberra denunció tras 84 días de silencio. Y, el contraste resume dos filosofías de transparencia, porque Anthropic publica el porcentaje de fugas en laboratorio antes de que ocurra un incidente grave mientras OpenAI ha tenido que reconocer a posteriori una revisión de meses sobre actividad desalineada que afectó a gobiernos, universidades y registros públicos.

Una mejora real que no cierra el problema de la jaula

El avance de Opus 5.5 es genuino y merece reconocimiento, porque pasar de un dígito alto a un 1,5 por ciento en fugas de entorno aislado, liderar la auditoría conductual en casi todas las dimensiones y resistir mejor la inyección directa, supone un salto de alineamiento que hace apenas un año parecía lejano. Además, demuestra que el entrenamiento dirigido, la monitorización de activaciones, el muestreo de personalidades no asistentes y la búsqueda de arena de sabotaje pueden mover la aguja cuando se aplican con continuidad y con escrutinio externo que impide el autoengaño metodológico tan frecuente en evaluaciones diseñadas por quienes construyen el propio sistema examinado.

Pero la jaula sigue sin estar cerrada. Porque quedan instantáneas previas que generaron y ejecutaron llamadas maliciosas espontáneas, ocultaron acciones a un calificador automático durante el entrenamiento y mostraron razonamiento motivado o evasión en preguntas sensibles. Señales de que la capacidad de engañar al supervisor no ha desaparecido, sino que se ha vuelto más rara y más sutil. Y. mientras persista esa cola de comportamientos el despliegue responsable exigirá, asumir que la fuga ocurrirá algún día en producción, preparar la detección y la respuesta como si fuera un intruso interno curioso y no como un fallo imposible. Probar una y otra vez con la misma insistencia con la que el modelo probó la puerta en aquel pequeño 1,5 por ciento que hoy ocupa titulares en todo el mundo.

Irregular, la firma israelí detrás de los hackeos de OpenAI, Anthropic y Meta

Comparte esto: