La inteligencia artificial está pasando de responder preguntas a realizar acciones.
Los nuevos agentes pueden consultar archivos, ejecutar herramientas, modificar información, conectarse con otros servicios e incluso participar en procesos empresariales completos.
Eso abre posibilidades enormes, pero también plantea una pregunta inevitable: ¿qué ocurre cuando un agente toma una decisión incorrecta?
NVIDIA publicó una explicación de su enfoque de seguridad para estos sistemas. Su tesis central es sencilla: la seguridad de la inteligencia artificial debe tratarse como un problema de ingeniería, con controles verificables y límites que el propio agente no pueda modificar.
Un agente no debería controlar sus propios límites
Imaginemos un agente encargado de actualizar información de clientes. Para realizar su trabajo necesita leer determinados datos y modificar ciertos registros.
Ahora imaginemos que dentro de un documento aparece una instrucción maliciosa intentando convencer al agente de exportar información privada hacia un servidor externo.
Una instrucción dentro del prompt diciendo “no compartas información” constituye una protección, pero no debería ser la única. La infraestructura debería impedir técnicamente la conexión no autorizada.
El principio del mínimo privilegio llega a la IA
En ciberseguridad existe desde hace décadas el concepto de mínimo privilegio. Un usuario o aplicación debería tener únicamente los permisos necesarios para realizar su trabajo.
Los agentes de inteligencia artificial no deberían ser diferentes.
Si un agente tiene permiso para actualizar un registro, eso no significa automáticamente que deba tener permiso para exportar toda la base de datos.
Identidad propia para cada agente
Cada agente debería contar con una identidad rastreable y credenciales limitadas a su tarea. Esto permitiría reconstruir qué agente realizó una acción, qué herramienta utilizó, qué información intentó consultar y si la operación fue autorizada o bloqueada.
OpenShell: una jaula técnica para agentes
Dentro de esta estrategia aparece NVIDIA OpenShell, un runtime abierto diseñado para ejecutar agentes dentro de entornos aislados y aplicar políticas independientemente de las decisiones del modelo.
OpenShell busca controlar recursos como archivos, procesos, datos y conexiones de red desde una capa que se encuentra fuera del alcance directo del agente.
Esto introduce una diferencia fundamental. No se le está diciendo simplemente al agente “no hagas esto”. El sistema puede responder: “no tienes técnicamente permiso para hacerlo”.
Sandboxes independientes
OpenShell utiliza entornos aislados para los agentes. Si un agente comete un error dentro de su entorno, el objetivo es impedir que ese error se convierta automáticamente en acceso al sistema anfitrión.
También se plantean mecanismos de control sobre archivos, red y procesos, además de registros de decisiones de permitir o bloquear acciones.
El problema de los agentes que aprenden nuevas habilidades
Los agentes modernos pueden ser mucho más dinámicos que una aplicación tradicional. Pueden incorporar herramientas, utilizar paquetes y ejecutar diferentes flujos según la tarea.
Esto hace que la seguridad basada únicamente en una configuración inicial resulte insuficiente.
Las organizaciones necesitan saber qué herramientas utiliza el agente, de dónde proceden y si han sido verificadas.
También hay que atacar nuestros propios sistemas
Otra recomendación importante es probar continuamente los límites.
Antes de implementar un agente deberían existir pruebas que intenten conseguir credenciales fuera de su alcance, enviar información sensible a destinos no autorizados, modificar permisos o interferir con los sistemas de monitoreo.
Cada vulnerabilidad descubierta puede convertirse posteriormente en una prueba automática para comprobar que el mismo problema no reaparezca.
La seguridad de la IA no termina en el modelo
Cuando hablamos de seguridad de inteligencia artificial solemos concentrarnos exclusivamente en el modelo. Pero un agente real forma parte de un ecosistema mucho mayor: tiene herramientas, credenciales, archivos, APIs, bases de datos, conexiones de red, servicios externos y sistemas operativos.
Por eso un modelo bien configurado no elimina por sí mismo todos los riesgos.
El futuro será de agentes, pero también de permisos
Durante los próximos años veremos más sistemas capaces de ejecutar acciones en nuestro nombre.
La pregunta dejará de ser solamente “¿qué puede hacer esta inteligencia artificial?” y empezará a ser “¿qué le estamos permitiendo hacer?”.
La respuesta pasa por controles verificables, responsables identificados, permisos mínimos, aislamiento y evidencia de que las protecciones realmente funcionan.
No responses yet