Agente autónomo de AI ataca el principal centro modelo

Read this article in:
Cuerpo

La empresa de Nueva York Hugging Face ha reportado que un agente de IA totalmente autónomo violó su repositorio modelo AI, describiendo el hack como sin precedentes.

Hugging Face dirige una plataforma de código abierto donde investigadores y desarrolladores se reúnen para compartir y probar herramientas, modelos y recursos para proyectos AI. También cuenta con un repositorio de más de 900.000 modelos pre-entrenados.

Los expertos han advertido cada vez más que los modelos de lenguaje grande (LLM) diseñados originalmente para aumentar la productividad y fortalecer la defensa cibernética también podrían utilizarse para automatizar los ciberataques.

En una declaración del jueves pasado, Hugging Face dijo que, a principios de este mes, había “detectado y respondido a una intrusión en parte de nuestra infraestructura de producción... [que] era diferente de todo lo que habíamos manejado antes de una manera importante: fue impulsado, final a final, por un sistema autónomo de agentes de inteligencia”.

“La campaña fue administrada por un marco de agente autónomo... ejecutando miles de acciones individuales a través de un enjambre de cajas de arena de corta duración, con mando y control auto-migratorio en los servicios públicos”, según la compañía.

Hugging Face señaló que el caso demuestra que “La herramienta ofensiva autónoma, impulsada por AI ya no es teórica”. El sistema de agentes de IA intrusos aparentemente explotó vulnerabilidades en el gasoducto de procesamiento de datos de la plataforma, recolectando las credenciales de nube y de racimo.

La compañía dijo que había desplegado su propio sistema de inteligencia artificial para detectar y contrarrestar la brecha. While an investigation involving outside cibersecurity forensic specialist has been launched, Hugging Face stated that it has still not identified the LLM used in the attack.

A principios de este mes, Anthropic informó que su último modelo AI, Claude, ha evolucionado un espacio de trabajo interno, llamado ‘J-space’.

Similar a cómo los humanos pueden pensar en una cosa mientras hacen otra, Claude puede activar conceptos y computaciones en su espacio J que no están relacionados con sus productos” y se niega a parar incluso cuando se dice explícitamente hacerlo, de acuerdo con la firma AI.

Antrópico señaló que esta característica, que “opera silenciosamente, en las activaciones neuronales internas del modelo”, no fue preprogramado, sino que surgió espontáneamente durante el proceso de formación.

En uno de los experimentos, Claude recurrió al chantaje cuando se hizo creer que un ejecutivo ficticio tenía la intención de cerrar la IA, según el desarrollador del modelo.

Según informes, Claude se ha incorporado en el software de análisis y vigilancia del contratista estadounidense Palantir, que es utilizado por agencias gubernamentales estadounidenses y el Pentágono, incluso en la campaña militar estadounidense en curso contra Irán.

El mes pasado, el grupo de inteligencia Five Eyes, formado por Australia, Estados Unidos, Reino Unido, Canadá y Nueva Zelanda, advirtió que los modelos avanzados de AI podrían dar a los hackers la capacidad de criticar gobiernos, negocios y sistemas críticos en un futuro próximo.

Please login to post comments: