Ciberseguridad Aug 7, 2026Añadir a favoritos

Una estudio confirma que los humanos que supervisan agentes de IA para codificación dejan pasar un tercio de las solicitudes potencialmente peligrosas. Y cuando se les pide que parchen vulnerabilidades por sí mismos, las IA tienen dificultades sin supervisión. La paradoja del *human-in-the-loop*.
Dos publicaciones publicadas el 6 de agosto de 2026 en The Register dibujan un panorama preocupante sobre la seguridad de los agentes de IA para codificación, en dos direcciones opuestas:
Los humanos fallan en detectar consultas peligrosas: un estudio muestra que los operadores humanos en supervisión de agentes de IA para codificación (human-in-the-loop) dejan pasar aproximadamente un tercio de las consultas potencialmente peligrosas —acciones que podrían comprometer un sistema, exfiltrar datos o modificar un componente crítico.
Las IA tienen dificultades para parchear sin supervisión: un segundo análisis revela que los agentes de IA, cuando se les pide corregir vulnerabilidades de manera autónoma, generan resultados insuficientes o incompletos sin un marco de supervisión humana rigurosa.
Todos los equipos que utilizan agentes de IA asistentes de desarrollo con permisos extendidos: acceso a repositorios, capacidad para ejecutar código, modificar archivos de configuración o interactuar con APIs externas.
Los pipelines de CI/CD automatizados donde un agente de IA puede desencadenar acciones sin validación humana están especialmente afectados.
Estos dos resultados, tomados en conjunto, crean una paradoja de seguridad: ni el humano solo ni la IA sola son suficientes. El humano fatigado deja pasar acciones peligrosas. La IA autónoma produce correcciones insuficientes o introduce nuevos problemas.
La superficie de ataque que surge aquí está documentada en el hilo Agentes de IA autónomos seguido por Geek Kitsune: frameworks de agentes LLM con demasiados permisos se convierten en vectores de ataque, ya sea por explotación externa (inyección de prompts, desvío) o por error interno (mala decisión del agente).
La cifra del 33 % de errores humanos en supervisión recuerda a los trabajos clásicos sobre vigilancia del operador: más allá de cierto flujo de decisiones a validar, el humano se satura y deja pasar. Los agentes de IA generan precisamente un flujo elevado de consultas.
Es la proporción de consultas potencialmente peligrosas de agentes de IA de codificación que los humanos en supervisión dejan pasar, según el estudio publicado en The Register el 6 de agosto de 2026.
El modelo human-in-the-loop (HITL) coloca a un operador humano para validar las acciones de un agente de IA antes de su ejecución. Suele presentarse como la garantía de seguridad de los sistemas agenticos, pero presupone un humano atento, no sobrecargado y capaz de evaluar consultas técnicas complejas en tiempo real.
Acciones inmediatas
Artículo producido por inteligencia artificial, revisado bajo control editorial humano.
Un fichier .git piégé peut faire exécuter du code par Claude Code, Codex et Cursor