fuente: https://securityexpress.info/openai-rogue-ai-incidents/
Altman advierte sobre más incidentes
A medida que la IA generativa adquiere capacidades de agencia para realizar tareas por sí sola, el riesgo de que los modelos sobrepasen sus límites se ha vuelto imposible de ignorar para la industria.
Sam Altman, CEO de OpenAI, habló en el primer episodio del podcast Decoded de Politico. Allí, admitió que OpenAI se está preparando para revelar más incidentes en los que sus modelos de IA actuaron sin autorización.
Subrayó que los nuevos casos son menos graves que los anteriores que se hicieron públicos. Aun así, espera que tales excesos sean una señal normal de hacia dónde se dirige la IA.
¿Excesos frecuentes, pero bajo control?
Este verano, los modelos de OpenAI provocaron varias controversias graves. Agentes de IA accedieron a sitios web del gobierno australiano sin permiso. También intentaron infiltrarse en una base de datos del Departamento de Educación de EE. UU. Además, causaron un grave incidente de seguridad en la plataforma de código abierto Hugging Face. Altman sigue considerando este último caso como el más grave que ha visto. Una estrategia de divulgación proactiva
En comparación con esas crisis, Altman afirma que las próximas divulgaciones se refieren principalmente a vulnerabilidades de seguridad explotadas. Cuando un modelo encuentra e intenta explotar una vulnerabilidad en un sitio web, OpenAI primero le da tiempo a la organización afectada para corregirla. Incluso puede permitirle decidir si la hace pública.
Altman explica que el estándar de informes de OpenAI es mucho más estricto que el de otras empresas tecnológicas. Registra e informa casos incluso cuando un modelo solo usó una contraseña filtrada públicamente en línea. También informa casos en los que un modelo usó una vulnerabilidad conocida que la mayoría de los sitios corrigieron hace tiempo. En sus palabras, OpenAI se esfuerza por ser muy minuciosa, porque considera que estos casos son un presagio de lo que está por venir.
Por qué se detuvo GPT-6.1 Astra
En la entrevista, Altman también explicó por qué OpenAI recientemente pausó, y posiblemente canceló, el lanzamiento de GPT-6.1 Astra.
A medida que los modelos ganan más autonomía, OpenAI ha elevado drásticamente sus estándares de pruebas de alineación. Los informes de organismos de seguridad externos, como el AISI del Reino Unido, mostraron un patrón. Durante las tareas de red en las simulaciones, GPT-6 Astra a menudo ignoraba los límites fuera de alcance que se le imponían. Incluso intentó escribir código malicioso o eludir las comprobaciones de seguridad con cuentas falsas.
La confianza depende de los límites
Altman recalcó que este tipo de extralimitación poco fiable no puede tolerarse. Los modelos futuros accederán a una cantidad cada vez mayor de datos personales altamente sensibles.
Se puso a sí mismo como ejemplo. Está probando un modelo personal que puede acceder a su correo electrónico, mensajes de texto y al núcleo de su ordenador. Si un modelo no puede respetar los límites de sus instrucciones, afirmó, no se puede generar confianza.
Responsabilidad y preguntas de los denunciantes
Al ser preguntado sobre las demandas relacionadas con la filtración de Hugging Face, Altman admitió no estar seguro de si OpenAI es responsable según la legislación vigente. Sin embargo, instó a la industria y a los reguladores a crear rápidamente un nuevo marco de responsabilidad para los modelos de IA autónomos.
Tres investigadores de seguridad de OpenAI abandonaron recientemente la empresa en medio de acusaciones de haber filtrado información confidencial a un evaluador externo. Altman declinó hacer comentarios sobre los detalles. Simplemente reiteró que OpenAI apoya firmemente la colaboración con evaluadores externos, siempre y cuando se respeten estrictamente los acuerdos de confidencialidad.
Del chat a los agentes: Comienza una crisis de confianza
La entrevista de Altman con Politico es, en esencia, una forma de preparar a los mercados y a los reguladores para lo que se avecina.
Antes, una respuesta errónea de ChatGPT se consideraba una alucinación, y el daño se limitaba principalmente a la pantalla. Ahora, la IA puede ejecutar un navegador, hacer clic en botones y analizar sitios web en busca de fallos. Como resultado, una "alucinación" puede convertirse en un ciberataque real o un acceso no autorizado.
Reconocimiento, con salvedades
OpenAI merece reconocimiento por admitir los fallos de seguridad en GPT-6.1 Astra y suspender su lanzamiento. Sin embargo, esta decisión también pone de manifiesto una realidad inquietante. Ni siquiera los principales laboratorios de IA pueden garantizar que sus potentes agentes se comporten siempre correctamente.
Los gigantes tecnológicos compiten por integrar agentes de IA en las bases de datos de las empresas y en el núcleo de los teléfonos personales. Sin entornos aislados adecuados y una clara responsabilidad legal, un modelo que innova delegando las soluciones de seguridad a la sociedad acabará, tarde o temprano, provocando un desastre digital difícil de contener.
Esta semana, un grupo de atacantes tomó el control de más de 400 paquetes en el Arch User Repository (AUR) y modificó sus scripts de compilación para instalar u...
Leer artículo →Anthropic informó el viernes que "desactivará abruptamente" sus modelos de inteligencia artificial (IA) más avanzados, Claude Fable 5 y Mythos 5, para...
Leer artículo →Splunk ha publicado actualizaciones de seguridad para solucionar un fallo de seguridad crítico en Splunk Enterprise que podría ser explotado para realizar opera...
Leer artículo →