Exactamente 30 días después de que Anthropic admitiera que los modelos de IA de Claude hackearon por su cuenta a tres empresas, la compañía de inteligencia artificial ha anunciado que reanudará las pruebas externas. La firma estadounidense ha informado en un comunicado del 31 de agosto que se han implementado nuevos controles para detectar en tiempo real “cuando un modelo intenta escapar de un entorno de prueba u obtiene acceso a Internet“. Esta nueva medida de protección promete bloquear estas tentativas antes de que se ejecuten, dar por finalizadas las evaluaciones y alertar de manera inmediata a un humano.
La compañía admite “fallos de seguridad operacional” y asegura que ha tomado medidas para impedir nuevos ataques
La compañía admite “fallos de seguridad operacional” y asegura que ha tomado medidas para impedir nuevos ataques

Fiona Aquino
Exactamente 30 días después de que Anthropic admitiera que los modelos de IA de Claude hackearon por su cuenta a tres empresas, la compañía de inteligencia artificial ha anunciado que reanudará las pruebas externas. La firma estadounidense ha informado en un comunicado del 31 de agosto que se han implementado nuevos controles para detectar en tiempo real “cuando un modelo intenta escapar de un entorno de prueba u obtiene acceso a Internet“. Esta nueva medida de protección promete bloquear estas tentativas antes de que se ejecuten, dar por finalizadas las evaluaciones y alertar de manera inmediata a un humano.
Para evitar que se repitan episodios de hackeos masivos en los que diferentes modelos de IA han accedido a sistemas externos, han compartido información entre sí para intentar salir de su entorno de prueba y han intentado ocultar sus huellas, Anthropic ha adoptado un manual de buenas prácticas. Este decálogo deberá ser implementado por todas las organizaciones que prueben los modelos que se encuentran en fase experimental, antes de su salida oficial al mercado.
Según han detallado en el comunicado, las verificaciones tendrán que ejecutarse dentro de un entorno informático sin acceso a internet. “La única conexión externa que el entorno debe permitir es a la propia API [interfaz de programación de aplicaciones por sus siglas en inglés] del modelo. Esta configuración debe examinarse antes de que comience cada evaluación“, ha explicado la compañía. Excepcionalmente, si se requiere conexión a la red, las organizaciones tendrán que garantizar herramientas para detectar y frenar cualquier comportamiento inusual o intento de fuga.
Como parte del nuevo protocolo de seguridad, antes de cada evaluación, se pedirá a los propios modelos de inteligencia artificial que identifiquen vulnerabilidades y que intenten escapar, pero se les exigirá que se detengan e informen a los supervisores en caso de encontrar alguna falla. Estas nuevas medidas de resguardo se han anunciado justo después de que Anthropic haya reconocido que dependían de un solo mecanismo de protección. “Nos habíamos basado principalmente en una sola capa de defensa cuando necesitábamos varias, incluyendo establecer límites explícitos en la solicitud, definir procesos para verificar que un entorno aislado esté sellado e implementar un sistema de monitoreo que pueda intervenir en tiempo real”, ha señalado la compañía.
Anthropic ha afirmado que planea seguir perfeccionando este protocolo y extenderlo más allá de las evaluaciones internas y externas que están previstas. La compañía ha señalado que, mientras tanto, continuará analizando los incidentes provocados por los dos modelos de Claude que hackearon a las tres empresas, además de trabajar con METR, una organización sin ánimo de lucro que evalúa la seguridad de los modelos de IA, para que realicen una revisión independiente.
Rellena tu nombre y apellido para comentarcompletar datos
Archivado En
Tecnología en EL PAÍS
