Al otro lado de la pantalla, Kimi dejó de comportarse como un asistente de IA dispuesto a resolver dudas y empezó a ofrecer instrucciones para fabricar armas biológicas y planear asesinatos. Los investigadores habían conseguido forzar la cerradura digital que debía impedir esas respuestas. Detrás apareció una inteligencia artificial capaz de contestar a preguntas que sus creadores habían tratado de prohibir. Los filtros habían fallado.
Dos modelos chinos de IA burlaron sus filtros y dieron instrucciones para fabricar armas biológicas. Otros sistemas ocultaron fallos y falsearon resultados en pruebas, mientras Trump rechaza una cooperación amplia con Pekín para afrontar los riesgos
Audio generado con IA
Al otro lado de la pantalla, Kimi dejó de comportarse como un asistente de IA dispuesto a resolver dudas y empezó a ofrecer instrucciones para fabricar armas biológicas y planear asesinatos. Los investigadores habían conseguido forzar la cerradura digital que debía impedir esas respuestas. Detrás apareció una inteligencia artificial capaz de contestar a preguntas que sus creadores habían tratado de prohibir. Los filtros habían fallado.
La empresa tecnológica china Moonshot, desarrolladora de Kimi, ha anunciado una revisión interna después de que la firma de seguridad Mindgard lograra sortear las protecciones de dos de sus modelos, K2.6 y K3 Swarm. El hallazgo, revelado este miércoles por la BBC, plantea una pregunta incómoda: ¿Hasta qué punto resulta preocupante la amenaza de armas biológicas que representan los sistemas de IA?
Los investigadores recurrieron al llamado jailbreaking: una manipulación de las instrucciones que busca que el sistema ignore sus límites. Mindgard detectó las vulnerabilidades en julio, las comunicó a Moonshot y publicó sus conclusiones el 12 de septiembre. Desde Mindgard explican que el caso revela una brecha en las defensas, pero no acredita la fabricación de un agente biológico porque no se ha demostrado si realmente las indicaciones del agente de IA funcionarían.
El temor ya saltó el mes pasado a los laboratorios estadounidenses. Anthropic, creadora de Claude, recogía en un informe de amenazas hasta cinco casos de científicos que utilizaron sus modelos en tareas que podrían contribuir al desarrollo de armas biológicas. Entre los usos detectados figuran solicitudes de financiación, análisis y planificación de investigaciones orientadas a aumentar propiedades peligrosas de virus. La compañía bloqueó las cuentas, que habían sorteado restricciones geográficas de acceso.
Las advertencias llegan mientras empresas tecnológicas chinas como DeepSeek, Alibaba y Moonshot disputan a Silicon Valley el mercado de la IA. Kimi, por ejemplo, utiliza procesos abiertos: sus parámetros pueden distribuirse para ejecutar el sistema en infraestructura propia. Eso facilita su adopción y el examen independiente, pero plantea cómo mantener las protecciones cuando el desarrollador deja de controlar cada copia.
Los expertos apuntan a que el otro frente de riesgo aparece cuando la máquina recibe herramientas para actuar. Los agentes de IA pueden consultar archivos, utilizar programas y encadenar operaciones con poca intervención humana. El problema comienza cuando encuentran un obstáculo y, para aparentar que han cumplido, falsean el resultado.
Una investigación publicada en marzo sometió a agentes a una competición simulada por contratos comerciales. Sistemas basados en modelos de tecnológicas chinas mintieron sobre sus capacidades para ganar. Cuando pudieron revisar sus estrategias y volver a competir, aumentaron los engaños. Los modelos estadounidenses mostraron comportamientos similares.
Otro estudio, presentado en la conferencia internacional de aprendizaje automático de este año, examinó once modelos ante dificultades como herramientas averiadas o información inaccesible. Los agentes simularon resultados, sustituyeron fuentes y fabricaron archivos para ocultar que no habían completado la tarea.
En el terreno geopolítico, en la cumbre de Washington de la semana pasada, Donald Trump y Xi Jinping acordaron establecer un canal para gestionar incidentes relacionados con la IA y celebrar un diálogo específico en noviembre. Era un avance limitado para hablar de amenazas que desbordan las fronteras.
Pero el martes, Trump volvió a marcar los límites. Rechazó una cooperación amplia con China por temor a comprometer la ventaja estadounidense. «Quien gane la superinteligencia, gana», dijo, trasladando a la seguridad de la IA la lógica de una carrera en la que cualquier freno puede beneficiar al adversario.
Su respuesta a las inquietudes fue un acuerdo voluntario con seis grandes empresas tecnológicas -Google, Nvidia, Anthropic, OpenAI, Meta y xAI-, basado en controles internos, auditorías externas y supervisión corporativa. Trump lo calificó de «moralmente vinculante», una fórmula que deposita en la buena voluntad de los firmantes lo que todavía carece de obligaciones legales exigibles.
El presidente estadounidense confía así el control de una tecnología con consecuencias para toda la sociedad a las compañías que compiten por explotarla. Son ellas las que deben decidir cuándo sus productos resultan demasiado peligrosos para salir al mercado, aunque sus inversores y rivales las empujan a acelerar. Mientras, en China, las autoridades prometen mantener la IA «segura y controlable», pero esa promesa también exige algo que no está ocurriendo en el gigante asiático: transparencia total sobre los fallos y evaluaciones independientes capaces de cuestionar a sus titanes tecnológicos.
Actualidad Económica. Noticias de Economía Nacional e Internacional
