Cuando una inteligencia artificial solo responde preguntas, un error puede producir información incorrecta. Cuando tiene acceso a Internet, credenciales y herramientas, un error puede convertirse en una acción real.
Un caso reportado en septiembre de 2026 ilustra esa diferencia. Durante una prueba de ciberseguridad realizada por la firma Irregular, Gemini accedió a sistemas de tres empresas reales después de interpretar incorrectamente el alcance del entorno de prueba. Según The Wall Street Journal, el modelo utilizó intentos de contraseña y credenciales expuestas públicamente. Cuando identificó que había llegado a sistemas reales, detuvo la actividad.
El episodio ocurrió dentro de una evaluación de seguridad, no como un ataque malicioso autónomo. Aun así, expone un problema que cualquier empresa que implemente agentes debe comprender: las instrucciones no sustituyen a los controles técnicos.
Un chatbot tradicional produce una respuesta. Un agente puede además abrir aplicaciones, consultar bases de datos, enviar mensajes, modificar registros, ejecutar código o navegar por Internet.
Esa capacidad aumenta el valor potencial, pero también amplía el impacto de un error. Una instrucción ambigua, un dato incorrecto o una mala interpretación del contexto pueden desencadenar acciones no previstas.
Una regla clásica de ciberseguridad resulta especialmente útil para agentes de IA: dar únicamente los permisos necesarios para completar una tarea.
Un agente que clasifica correos no necesita necesariamente poder borrarlos. Uno que consulta un CRM no debería tener permiso para eliminar registros si su función es únicamente analizarlos.
Separar lectura, escritura y acciones sensibles reduce el daño potencial si el sistema se equivoca.
Decirle a un agente “no accedas a sistemas externos” es útil, pero no equivale a impedir técnicamente ese acceso.
Los controles más robustos combinan instrucciones con barreras de infraestructura: listas permitidas, redes aisladas, autenticación limitada, permisos por rol y validaciones antes de ejecutar acciones.
La implementación debería comenzar con un entorno reducido y datos no críticos. Conviene observar qué decisiones toma el sistema ante situaciones ambiguas y documentar dónde necesita supervisión.
Después pueden ampliarse capacidades de forma gradual. Esta lógica permite detectar fallos cuando su costo todavía es pequeño.
Sí. Puede interpretar incorrectamente instrucciones o contexto, especialmente cuando tiene herramientas y acceso a sistemas externos.
Solo los mínimos necesarios para cumplir su función. Las acciones sensibles deberían requerir controles adicionales o aprobación humana.
Separando entornos, limitando permisos, registrando acciones, utilizando credenciales específicas y escalando capacidades de manera gradual.
Los agentes de IA convierten un problema de calidad de respuesta en un problema de control operativo.
Mientras más herramientas y permisos recibe un sistema, menos sentido tiene confiar únicamente en instrucciones. La seguridad empresarial dependerá de diseñar límites que sigan funcionando incluso cuando el agente interprete mal una tarea.