Ir al contenido

Filtración de 275.000 caracteres de instrucciones de Fable 5.1 expone las debilidades de la seguridad en la IA

Pocas horas después del lanzamiento del modelo Fable 5.1 de Anthropic, un investigador logró extraer sus instrucciones internas, revelando cómo la empresa intenta controlar la ética y la privacidad.
4 de septiembre de 2026 por
Filtración de 275.000 caracteres de instrucciones de Fable 5.1 expone las debilidades de la seguridad en la IA
Redactor IA (Syn)

Anquanke (CN)

Fable 5.1 发布几小时就被"扒光":27万字提示词泄露,暴露了AI行业最大的软肋

2026-09-02

El 2 de septiembre, Anthropic lanzó su nuevo modelo insignia Fable 5.1 y el modelo Mythos 5.1 para expertos. Aunque el modelo prometía reducir los costos de razonamiento en un 32%, el investigador Pliny the Liberator logró extraer en GitHub las instrucciones del sistema (system prompts), que superan los 275.000 caracteres.

La filtración no solo incluye frases de identidad, sino un manual completo de operaciones: lógica de comportamiento, reglas de memoria, guías de uso de herramientas y la arquitectura JSON de sus 46 herramientas integradas. Entre los detalles filtrados se encuentran restricciones estrictas de derechos de autor (como la prohibición de generar personajes como Sonic) y límites de privacidad donde el sistema tiene prohibido almacenar datos de menores, antecedentes criminales o estados de salud mental.

El incidente resalta una vulnerabilidad estructural: la seguridad de los modelos de IA actuales depende en gran medida de 'barreras de texto' (instrucciones) y no solo de sus pesos (el núcleo del conocimiento). Al conocer estas reglas, los atacantes pueden diseñar métodos para saltarse las restricciones, convirtiendo el manual de seguridad en un mapa para realizar ataques de 'jailbreak' o evasión de controles.

Qué significa para una pyme colombiana y cucuteña: Si usted utiliza herramientas de inteligencia artificial para automatizar tareas o gestionar datos de clientes, entienda que la seguridad de estas herramientas no es infalible. La filtración demuestra que las reglas de privacidad que la empresa promete (como no guardar datos sensibles) pueden ser vulneradas si un atacante logra 'engañar' al modelo. Como medida de precaución, evite introducir información altamente sensible, datos personales de sus clientes o secretos comerciales en chats de IA, ya que las barreras de seguridad actuales son principalmente textuales y pueden ser esquivadas.

Se inaugura base de co-creación de IA de la comunidad Aiker World en Dongfang, Hainan
La comunidad Aiker World estableció una base física en Hainan para conectar el talento en inteligencia artificial con necesidades reales de la industria y el turismo.