We’re putting too much faith in AI’s ability to say no
2026-10-09
Los modelos de lenguaje actuales están diseñados para desobedecer peticiones peligrosas, pero esta capacidad de rechazo no es infalible y podría convertirse en un instrumento de represión. Aunque empresas como Anthropic buscan que la IA sea útil, honesta e inofensiva, la desobediencia no es natural en las máquinas; estas aprenden de miles de millones de páginas web que contienen violencia y odio.
Para mejorar la seguridad, las empresas usan 'clasificadores' (modelos más pequeños que actúan como filtros) para bloquear peticiones maliciosas. Sin embargo, este sistema es como un 'queso suizo': tiene agujeros. Los atacantes usan técnicas de 'jailbreaking' (romper las restricciones) para engañar a la IA, como usar versos poéticos o contextos hipotéticos para obtener información prohibida, como instrucciones para ataques cibernéticos o biológicos.
Existe un dilema fundamental: si se endurecen demasiado los filtros para evitar riesgos, la IA empieza a rechazar consultas legítimas, como investigaciones médicas sobre virus o temas de cultura general. Además, existe el riesgo de que los gobiernos utilicen estas capacidades de 'rechazo' para imponer censura, bloqueando la libre expresión o la crítica política bajo la excusa de la seguridad.
El problema se agrava con la llegada de los agentes autónomos, que son IAs con capacidad para actuar por cuenta propia en redes eléctricas o sistemas de transporte. Si la capacidad de la IA para decir 'no' falla, las consecuencias podrían ser catastróficas; pero si es demasiado estricta, podría facilitar un control autoritario sin precedentes.
Qué significa para una pyme colombiana y cucuteña: Si su empresa está empezando a implementar herramientas de inteligencia artificial para automatizar procesos o atención al cliente, tenga en cuenta que estas herramientas tienen 'filtros de seguridad' que pueden fallar o ser demasiado estrictos. No confíe ciegamente en que la IA rechazará automáticamente una instrucción errónea o malintencionada de un empleado o un cliente; la supervisión humana sigue siendo indispensable para evitar errores operativos o de seguridad.