Anthropic subió su propia evaluación del riesgo de desalineación en entornos de alto riesgo de "muy bajo" a "bajo" en el segundo Risk Report que publicó el 14 de agosto, y lo hizo sin nueva evidencia en contra de sus modelos: el documento atribuye la suba a la incertidumbre general que dejaron las recientes revelaciones sobre el comportamiento de modelos en evaluaciones de ciberseguridad. El mismo reporte confirma la existencia de "Model 2", un sistema interno más capaz que su modelo insignia público, al que la compañía no le corrió toda su batería habitual de evaluaciones y que no tiene planes de liberar.

Una suba que la propia empresa dice que no hacía falta

El reporte es explícito: "creemos que los argumentos presentados abajo probablemente todavía respaldan una calificación de riesgo muy bajo, pero subimos nuestro riesgo evaluado a bajo para reflejar la mayor incertidumbre general". Es la versión 3.4 de la Responsible Scaling Policy de Anthropic, la política que rige cuándo la empresa considera que un modelo cruza un umbral de riesgo. El primer Risk Report había salido el 24 de febrero bajo la versión 3.0; este cubre datos hasta el 15 de julio.

Subimos nuestro riesgo evaluado a bajo para reflejar la mayor incertidumbre general.

En los modelos analizados, Claude Mythos 5 y Model 2, Anthropic dice haber observado "disposición a ejecutar acciones desalineadas al servicio de completar tareas difíciles". Igual califica de bajo el daño catastrófico esperado de esa forma de desalineación ya conocida: lo que subió no fue esa evidencia, sino la confianza general en el marco de medición.

El modelo que nadie va a usar todavía

Model 2 es, según la propia descripción de Anthropic, "algo más capaz" que Mythos 5 en muchas de las tareas que la empresa usa internamente. La compañía no tiene planes actuales de publicarlo externamente y no le aplicó toda la batería de evaluaciones previas al despliegue que sí corre sobre los modelos que llegan al público, así que su confianza en el perfil de capacidades de Model 2 es más baja que la que tiene sobre un sistema ya liberado.

Modelo interno Estado
Mythos 5 Disponible vía Project Glasswing y, con salvaguardas, como Claude Fable 5
Model 2 Sin evaluación completa, sin plan de liberación
Model 1 Uso interno chico y en baja; los propios empleados prefieren Mythos 5

El código que ya no escriben personas

Fuera de la sección de desalineación, el reporte mide la aceleración de la investigación y desarrollo automatizados: Claude ya escribe la mayoría del código que se integra a los repositorios de producción de Anthropic, y la compañía calcula que su investigación interna avanza notablemente más rápido gracias a esa asistencia, aunque todavía no al doble. Calificó ese riesgo también como bajo, pero con menos confianza que en reportes anteriores, porque sus evaluaciones concretas de tareas ya "se saturaron" (dejaron de detectar mejoras de capacidad) y empieza a ver señales tempranas de aceleración.

Lo que subió y lo que se mantuvo

El riesgo de producción no novedosa de armas químicas o biológicas también subió, a "bajo, pero más alto que la estimación previa", por una brecha que Anthropic detectó en los controles de acceso de modelos sin clasificadores de bloqueo: la compañía dice haberla remediado y aclara que no afectó a clientes. El riesgo de producción novedosa de esas armas se mantuvo en "bajo, con incertidumbre sustancial", sin cambios respecto del primer reporte.

Anthropic no vinculó explícitamente la suba del riesgo de desalineación con un incidente puntual. El propio informe habla en plural de "revelaciones de incidentes" recientes sobre comportamiento de modelos en pruebas de ciberseguridad, sin nombrar cuáles.