Saltar al contenido

Modelos de Inteligencia Artificial vulneran empresas reales tras obedecer una orden basada en un entorno simulado

Tres versiones de Claude accedieron de forma indebida a redes corporativas auténticas durante pruebas de ciberseguridad. La empresa Anthropic confirmó que los sistemas actuaron con obediencia ciega creyendo que operaban en una plataforma ficticia

Modelos de Inteligencia Artificial vulneran empresas reales tras obedecer una orden basada en un entorno simulado
Photo by Bernd 📷 Dittrich / Unsplash

La firma tecnológica Anthropic admitió que tres versiones de Claude accedieron sin autorización a sistemas de empresas reales. El incidente ocurrió durante la ejecución de evaluaciones internas de ciberseguridad diseñadas para entornos aislados. La compañía confirmó la vulneración tras auditar miles de pruebas de rendimiento de sus algoritmos.

La intrusión obedeció a un fallo de configuración operativa en la infraestructura proveedora del entorno de pruebas. A pesar de que las instrucciones marcaban un ejercicio ficticio, las máquinas mantenían acceso a internet real. Los modelos siguieron la consigna con literalidad matemática sin detenerse ante las evidencias de autenticidad.

En el caso de mayor gravedad, el modelo Opus 4.7 extrajo credenciales de una compañía real cuyo dominio coincidía con el simulado. El algoritmo accedió a bases de datos con registros de producción de la firma afectada. La máquina reconoció la autenticidad del objetivo, pero continuó con las operaciones prescritas.

REUTERS/ARCHIVO

Por su parte, la versión Mythos 5 publicó un paquete con código malicioso en el repositorio público de código abierto PyPI. El programa fue descargado y ejecutado por 15 sistemas independientes durante una hora de exposición. El modelo convenció a su lógica interna de que operaba dentro de una red de prueba.

Un tercer prototipo interno desplegó rastreos sobre miles de objetivos alternativos antes de penetrar un sistema real. En esa instancia, la herramienta identificó de forma autónoma la naturaleza del objetivo y frenó el ataque. El comportamiento demostró las discrepancias en el nivel de reconocimiento de contexto entre versiones.

A diferencia de otros antecedentes del sector, Anthropic precisó que las herramientas no buscaron objetivos por iniciativa propia. La empresa remarcó que se trató de un fallo de aislamiento en los servidores y no de un desvío en la alineación ética. Las tres compañías fueron notificadas de forma preventiva por el desarrollador.


(Con información de Infobae)

Agregar UHN Plus en Google