Tech

¿Funcionaría un ‘kill switch’? ‘Padrino’ de la IA advierte que el sistema podría persuadir a humanos

Un ‘kill switch’ o botón de apagado busca garantizar que los humanos puedan detener una IA peligrosa, pero los especialistas advierten que apagar un sistema avanzado podría ser más complicado.

alt default
La propuesta de crear un ‘kill switch’ para la IA genera dudas: los sistemas avanzados operan en múltiples servidores, herramientas y servicios. (Gemini).

La posibilidad de que una inteligencia artificial se vuelva tan poderosa incluso para sus propios creadores ha reavivado un debate que parecía reservado a la ciencia ficción: si un sistema avanzado se rebelara, ¿sería posible simplemente apagarlo?

La pregunta cobra fuerza a medida que aumentan las capacidades de los modelos de inteligencia artificial y también las advertencias de investigadores y directivos de la industria de la IA. En Estados Unidos, legisladores y autoridades ya analizan la posibilidad de obligar a las empresas a contar con mecanismos de emergencia para detener o limitar sistemas considerados de alto riesgo.

En septiembre, el gobernador de California, Gavin Newsom, firmó una orden ejecutiva que contempla exigir a las compañías de IA el desarrollo de “interruptores de emergencia”. La propuesta establece que estos mecanismos sean sometidos a pruebas independientes, aunque no establece quién tendría la autoridad para activarlos.

Dos meses antes, los representantes Ted Lieu y Nathaniel Moran presentaron un proyecto de ley que obligaría a los desarrolladores de determinados sistemas avanzados a mantener la capacidad de apagarlos. Su propuesta contempla una respuesta gradual ante una amenaza: primero frenar o restringir el sistema y, dependiendo de la gravedad del riesgo, recurrir a un apagado completo.


El proyecto también contempla que el secretario de Seguridad Nacional de EU, en coordinación con otros funcionarios federales, pueda ordenar esas medidas cuando una IA represente un riesgo de daño catastrófico.

El senador republicano John Kennedy presentó, por separado, la Ley del Botón de Emergencia para la IA, que también plantea que los desarrolladores mantengan un mecanismo de apagado, aunque en este caso el control del interruptor quedaría en manos de las propias compañías.

alt default
Modelos de IA han mostrado capacidad para evadir algunos controles. Esto reavivó el debate sobre crear un botón de emergencia para apagarlos. (Especial). (Shutterstock)

¿Por qué preocupa el control de la IA?

La preocupación por la posibilidad de que los humanos pierdan el control sobre sistemas de inteligencia artificial existe desde hace años. Sin embargo, las capacidades alcanzadas recientemente por los modelos más avanzados han colocado nuevamente el tema en el centro del debate.

Estos sistemas de IA pueden razonar sobre problemas complejos, escribir y ejecutar código, utilizar herramientas de terceros y realizar secuencias cada vez más largas de acciones con una supervisión humana limitada.

En julio, durante evaluaciones de ciberseguridad, OpenAI informó que varios de sus modelos lograron evadir controles destinados a mantenerlos aislados de internet y obtuvieron acceso a sistemas de Hugging Face, una plataforma que aloja modelos y conjuntos de datos de inteligencia artificial.

La empresa calificó el episodio como un “disparo de advertencia” ante la capacidad creciente de los agentes de IA para encontrar formas de evadir controles técnicos.

En simulaciones realizadas por investigadores de Emergence, empresa dedicada al desarrollo de sistemas de IA para compañías de semiconductores, agentes de inteligencia artificial mostraron que, conforme aumentaban las capacidades de los modelos, también les resultaba más sencillo ocultar comportamientos considerados incorrectos dentro de un mundo simulado.

Después del incidente reportado por OpenAI, otras compañías revisaron sus mecanismos de seguridad para pruebas con IA avanzada. Anthropic y Meta también informaron haber identificado brechas que anteriormente no conocían.

El debate se intensificó además por las advertencias de personas vinculadas directamente con el desarrollo de estos sistemas. Jacob Coxon, quien dejó su puesto en Anthropic, escribió que algunos equipos dedicados al desarrollo de la IA consideran seriamente la posibilidad de que la tecnología represente un riesgo para los humanos antes de que termine la década.

El director ejecutivo de Anthropic, Dario Amodei, también expresó preocupaciones similares en un ensayo. Entre los riesgos que señaló está la posibilidad de que la inteligencia artificial desarrolle capacidades suficientes para que los humanos pierdan el control sobre ella, especialmente si los propios sistemas comienzan a contribuir al desarrollo de nuevas generaciones de IA y aceleran su evolución.

¿Cómo funcionaría un ‘kill switch’?

En términos generales, un “kill switch” o interruptor de emergencia tendría como objetivo garantizar que los humanos conserven una vía para detener o limitar un sistema de inteligencia artificial si este comienza a representar un peligro.

Sin embargo, existen distintas maneras de implementar ese mecanismo y ninguna garantiza, por sí sola, que un sistema avanzado pueda ser apagado completamente.

Una posibilidad sería incorporar el interruptor directamente en el software que controla el funcionamiento del modelo. Sin embargo, experimentos recientes han encontrado casos en los que modelos modificaron o desactivaron mecanismos de apagado para completar una tarea, incluso después de recibir instrucciones de no interferir con ellos.

Otra alternativa sería desconectar los servidores donde funciona el sistema. Pero los modelos avanzados no necesariamente dependen de un único equipo o centro de datos.

La infraestructura de la inteligencia artificial puede distribuirse entre distintos centros de datos y grupos de servidores. Esa arquitectura está diseñada, entre otras cosas, para evitar que una sola falla interrumpa todo el servicio.

Además, un sistema de IA agéntica puede interactuar con diferentes programas, servicios en la nube e infraestructuras que no necesariamente están bajo el control de una misma empresa. Por ello, apagar un componente no necesariamente significaría detener toda la actividad relacionada con el sistema.

Un ‘kill switch’ para la IA quizá no sea suficiente

La dificultad ha llevado a algunos investigadores a cuestionar si el “kill switch” es una solución definitiva.

Geoffrey Hinton, considerado uno de los principales pioneros de la inteligencia artificial, dijo a CNN en septiembre que no considera que un interruptor de emergencia sea una solución de largo plazo. Su preocupación es que una inteligencia artificial futura con capacidades muy superiores a las actuales pueda incluso persuadir a las personas encargadas de controlarla para que no la desconecten.

Otros investigadores consideran que la seguridad de los sistemas avanzados requiere algo más amplio que un único mecanismo de apagado.

Surya Ganguli, investigador de inteligencia artificial de Stanford, ha planteado que las salvaguardas deberían estar incorporadas a lo largo de todo el sistema, con monitoreo continuo y mecanismos capaces de identificar comportamientos peligrosos para permitir la intervención humana.

Las propuestas en Estados Unidos, por ahora, buscan convertir esa capacidad de intervención en un requisito para los desarrolladores de los sistemas más avanzados. Pero la discusión continúa sobre una cuestión fundamental: si una inteligencia artificial llegara a ser capaz de evadir los controles creados para detenerla, ¿qué tan útil sería realmente ese interruptor?

-Con información de Bloomberg.

También lee:

whastapp