Hace poco me llegó, dentro del equipo, un pull request que en teoría tocaba 4 archivos. Terminó tocando más de 20.
El modelo se había entusiasmado. Invocaba servicios que no existían en el código, intentó "arreglar" un problema que no existía, y de paso metió mano en archivos de infraestructura que no tenían nada que ver con la tarea. Todo con una seguridad total. Si lo mergeas sin mirar, te metes un problema que después cuesta caro desenredar.
Y no es un caso aislado. Justo esta semana salió un estudio sobre 576.000 fragmentos de código generado por IA: los modelos comerciales inventan cosas (métodos, librerías, paquetes que no existen) en promedio un 5% de las veces, y los abiertos más del 20%. Contaron más de 200.000 nombres de paquetes inventados. No es un bug raro, es cómo funcionan.
Acá está el punto, y va para cualquiera que use IA, programe o no: el LLM parece que siempre tiene la respuesta correcta, parece mágico, pero se equivoca. Y bastante. No hay todavía sustituto a la experiencia humana. Por eso hay que revisar todo y no asumir que está bien.
Piénsalo así: es igual que si alguien con poca experiencia te pasa algo hecho, y tú lo reenvías a un directorio o a un cliente sin leerlo antes. No lo harías. Con la IA es exactamente lo mismo — solo que escribe más rápido y suena más seguro.
En el equipo trabajamos con estas reglas, y sirven para cualquier proyecto, no solo de código:
Nadie confía 100% en el modelo. El que usa la IA revisa lo que sale y se hace responsable. La firma es tuya, no del modelo.
Todo pasa por al menos dos filtros: una revisión automática y una revisión de un humano con experiencia.
La IA acompaña, no lo sabe todo. Se lo repito al equipo hasta el cansancio. Es un copiloto, no el piloto.
Buen "harness" para todos: reglas y validaciones que atajen los errores típicos antes de que lleguen a alguien.
Pregunta ¿por qué?, inclusive preguntar al modelo por qué esta solución y no otra puede darte mejores resultados.
Si quieres el detalle técnico de cómo blindar un stack contra esto, lo escribí completo acá: Más allá del VibeCoding: la guía práctica para blindar tu stack contra el caos de la IA.
Pero si te llevas una sola cosa hoy: ponle un humano en el medio a todo lo que hace la IA antes de que salga por la puerta. Correo, propuesta, contrato, código. Léelo. Siempre.
Mañana: la primera automatización que de verdad me ahorró horas — con el antes y después en números.
Lo que pasó
Fable 5 volvió. Anthropic reactivó Claude Fable 5 a nivel global (30 jun – 1 jul), tras el levantamiento de los controles de exportación de EE.UU. Lo habían bajado a mediados de junio por una orden de seguridad, gatillada por un jailbreak que detectó Amazon, y antes de reponerlo le sumaron un clasificador de ciberseguridad reforzado. Detalle que refuerza lo de arriba: hasta los grandes laboratorios frenan un modelo para ponerle guardarraíles antes de soltarlo.
Y un informe de esta semana (AvePoint, State of AI 2026) encontró que el 88% de las organizaciones tuvo al menos un incidente de seguridad con agentes de IA en el último año. La supervisión humana no es opcional.