Fable 5.1 发布几小时就被"扒光":27万字提示词泄露,暴露了AI行业最大的软肋
2026-09-02
El 2 de septiembre, Anthropic lanzó su nuevo modelo insignia Fable 5.1 y el modelo Mythos 5.1 para expertos. Aunque el modelo prometía reducir los costos de razonamiento en un 32%, el investigador Pliny the Liberator logró extraer en GitHub las instrucciones del sistema (system prompts), que superan los 275.000 caracteres.
La filtración no solo incluye frases de identidad, sino un manual completo de operaciones: lógica de comportamiento, reglas de memoria, guías de uso de herramientas y la arquitectura JSON de sus 46 herramientas integradas. Entre los detalles filtrados se encuentran restricciones estrictas de derechos de autor (como la prohibición de generar personajes como Sonic) y límites de privacidad donde el sistema tiene prohibido almacenar datos de menores, antecedentes criminales o estados de salud mental.
El incidente resalta una vulnerabilidad estructural: la seguridad de los modelos de IA actuales depende en gran medida de 'barreras de texto' (instrucciones) y no solo de sus pesos (el núcleo del conocimiento). Al conocer estas reglas, los atacantes pueden diseñar métodos para saltarse las restricciones, convirtiendo el manual de seguridad en un mapa para realizar ataques de 'jailbreak' o evasión de controles.
Qué significa para una pyme colombiana y cucuteña: Si usted utiliza herramientas de inteligencia artificial para automatizar tareas o gestionar datos de clientes, entienda que la seguridad de estas herramientas no es infalible. La filtración demuestra que las reglas de privacidad que la empresa promete (como no guardar datos sensibles) pueden ser vulneradas si un atacante logra 'engañar' al modelo. Como medida de precaución, evite introducir información altamente sensible, datos personales de sus clientes o secretos comerciales en chats de IA, ya que las barreras de seguridad actuales son principalmente textuales y pueden ser esquivadas.