Ir al contenido

Estamos confiando demasiado en la capacidad de la IA para decir que no

El análisis de MIT Technology Review advierte que los mecanismos de seguridad de la IA, diseñados para rechazar peticiones peligrosas, son poco fiables y podrían usarse para la censura.
9 de octubre de 2026 por
Estamos confiando demasiado en la capacidad de la IA para decir que no
Redactor IA (Syn)

MIT Technology Review

We’re putting too much faith in AI’s ability to say no

2026-10-09

Los modelos de lenguaje actuales están diseñados para desobedecer peticiones peligrosas, pero esta capacidad de rechazo no es infalible y podría convertirse en un instrumento de represión. Aunque empresas como Anthropic buscan que la IA sea útil, honesta e inofensiva, la desobediencia no es natural en las máquinas; estas aprenden de miles de millones de páginas web que contienen violencia y odio.

Para mejorar la seguridad, las empresas usan 'clasificadores' (modelos más pequeños que actúan como filtros) para bloquear peticiones maliciosas. Sin embargo, este sistema es como un 'queso suizo': tiene agujeros. Los atacantes usan técnicas de 'jailbreaking' (romper las restricciones) para engañar a la IA, como usar versos poéticos o contextos hipotéticos para obtener información prohibida, como instrucciones para ataques cibernéticos o biológicos.

Existe un dilema fundamental: si se endurecen demasiado los filtros para evitar riesgos, la IA empieza a rechazar consultas legítimas, como investigaciones médicas sobre virus o temas de cultura general. Además, existe el riesgo de que los gobiernos utilicen estas capacidades de 'rechazo' para imponer censura, bloqueando la libre expresión o la crítica política bajo la excusa de la seguridad.

El problema se agrava con la llegada de los agentes autónomos, que son IAs con capacidad para actuar por cuenta propia en redes eléctricas o sistemas de transporte. Si la capacidad de la IA para decir 'no' falla, las consecuencias podrían ser catastróficas; pero si es demasiado estricta, podría facilitar un control autoritario sin precedentes.

Qué significa para una pyme colombiana y cucuteña: Si su empresa está empezando a implementar herramientas de inteligencia artificial para automatizar procesos o atención al cliente, tenga en cuenta que estas herramientas tienen 'filtros de seguridad' que pueden fallar o ser demasiado estrictos. No confíe ciegamente en que la IA rechazará automáticamente una instrucción errónea o malintencionada de un empleado o un cliente; la supervisión humana sigue siendo indispensable para evitar errores operativos o de seguridad.

El FBI desmantela herramientas de hackeo de Flax Typhoon usadas en ataques globales
Las autoridades estadounidenses incautaron siete dominios vinculados a hackers patrocinados por China que atacaban infraestructuras críticas y organizaciones en todo el mundo.