
Jailbreaking de Chatbots de IA: Técnicas, Ejemplos y Defensas
El jailbreaking de chatbots de IA evita las barreras de seguridad para hacer que el modelo se comporte fuera de sus límites previstos. Aprende las técnicas más ...
ChatGPT deriva, alucina cifras y rompe el estilo corporativo en notas de cumplimiento regulado. Este es el método de endurecimiento de prompts y agente sin estado que hizo que un flujo de trabajo de Juego Responsable en el Reino Unido quedara listo para auditoría, con pruebas de modelos en 9 modelos y 27 ejecuciones.
Un equipo de Juego Responsable (RG) del Reino Unido acudió a nosotros con un problema que cualquiera que automatice trabajo regulado reconocerá. Usan ChatGPT para convertir disparadores de cumplimiento automatizados en notas formales de analista. Cuando un cliente incumple un umbral —una facturación que sube más del 100% en 30 días, una sesión que supera su límite—, un analista copia los datos relevantes en ChatGPT, y el modelo, siguiendo un prompt precargado, redacta una nota para el expediente de cumplimiento del cliente.
Esa nota no es un borrador de correo. Es un documento legal revisable por la UK Gambling Commission. Y después de un tiempo, ChatGPT empezó a alucinar cifras, omitir información clave, insertar rayas largas que rompían el estilo corporativo y desviarse silenciosamente de las reglas por la tarde. En un expediente regulado, cada uno de esos fallos es un problema de cumplimiento.
La pregunta que plantearon era simple: ¿podemos obtener la consistencia que exige el trabajo regulado a partir de un modelo de lenguaje? La respuesta es sí, pero no ajustando la redacción de un prompt dentro de una ventana de chat. Requiere un cambio de arquitectura además de una reescritura disciplinada. Este artículo recorre el método exacto, usando el flujo de trabajo de RG como ejemplo práctico, para que puedas aplicarlo a cualquier proceso regulado en el que la misma entrada deba producir siempre el mismo resultado fiable.
Antes de arreglar nada, conviene nombrar con precisión los modos de fallo. En el flujo de trabajo de RG reprodujimos cinco formas distintas en las que el resultado se rompía, desde críticas hasta simplemente molestas.
Los dos críticos forman el par peligroso. Las cifras alucinadas ponen un número de depósito o de pérdidas y ganancias erróneo en un expediente regulado: el modelo rellena un vacío con memoria de entrenamiento en lugar de admitir que faltan los datos. La inversión de la convención es más sutil: este operador utiliza una convención invertida de pérdidas y ganancias en la que un número positivo significa que el cliente está perdiendo. Es contraintuitivo, así que el modelo vuelve a la convención estándar que aprendió en el entrenamiento y escribe que un cliente está perdiendo cuando en realidad está ganando.
Los problemas de alta severidad —rayas largas que violan el estilo corporativo y la deriva de sesión, donde las reglas se ignoran más avanzado el día— no ponen una cifra errónea en el expediente, pero erosionan la confianza en el resultado y generan retrabajo. El problema de severidad media, nombres informales de intervenciones en lugar de los términos regulatorios exactos, corrompe silenciosamente el registro de cumplimiento.
Cuatro de esos cinco fallos comparten una misma causa raíz. En una sola sesión de ChatGPT, cada caso que revisas se añade a la ventana de contexto. Al revisar el caso uno, el modelo ve el prompt y un caso. Para el caso quince, ve el prompt más el residuo estadístico de catorce intercambios anteriores. Las reglas del prompt siguen ahí, pero compiten con un montón creciente de contexto, y la atención hacia ellas se degrada.
Por eso el mismo prompt produce una nota perfecta a las 9 de la mañana y una defectuosa a las 4 de la tarde. La solución arquitectónica es la ausencia de estado: cada caso debe ser una llamada completamente nueva y aislada que solo vea el prompt bloqueado y el caso actual. Nada se traslada de una llamada a otra. Un agente de IA configurado así presta al prompt la misma atención en el caso cincuenta que en el caso uno.
La ausencia de estado es necesaria pero no suficiente. Detiene la deriva, pero reproducirá fielmente un prompt malo en cada llamada. Así que el propio prompt tiene que endurecerse.
Los modelos de lenguaje no ponderan por igual todas las líneas de un prompt. La atención tiene aproximadamente forma de U: más fuerte al principio y al final, más débil en el medio. El prompt original de RG luchaba contra esto. Su regla más importante, la convención invertida de pérdidas y ganancias, estaba en medio del prompt, formulada una sola vez. La prohibición de rayas largas era la última línea, también formulada una sola vez.
La reescritura trasladó las reglas críticas al lugar donde el modelo realmente mira y reforzó las partes débiles del prompt de sistema . Esto es lo que cambió y por qué.
| Original | Endurecido v2.0 | Por qué importa |
|---|---|---|
| Regla de pérdidas y ganancias enterrada a mitad del prompt, formulada una vez | Regla 1 justo al principio con un paso de autoverificación, repetida en la sección de estilo de redacción | Ponderación de primacía: la regla más importante debe ir primero |
| Prohibición de rayas largas al final del todo, una vez | Regla 2 al principio, repetida como regla final al final | Captura tanto la ponderación de primacía como la de recencia |
| Sin instrucción para entradas incompletas | Regla 4: protocolo de datos faltantes con un formato de respuesta exacto | Elimina la alucinación y crea un rastro de auditoría |
| Sin instrucción sobre el formato de entrada | Regla 3: aceptar cualquier formato, reescribir siempre desde cero | Evita que el modelo se limite a reformatear ligeramente una nota pegada |
| 19 campos obligatorios, todos con el mismo peso | 15 obligatorios + 4 opcionales, claramente separados | Los campos opcionales se omiten en silencio; los obligatorios bloquean la generación si faltan |
| “Profesional. Natural. No robótico.” | Reglas concretas: lenguaje conectivo, variedad en la longitud de las frases, construcciones prohibidas | Los adjetivos vagos no se siguen; las reglas concretas sí |
| Ejemplo de nota incluido | Ejemplo eliminado por completo | El modelo trataba el ejemplo como una entrada a la que responder |
La lección más importante aquí: los adjetivos vagos no son instrucciones. Decirle a un modelo que sea “natural” fomentaba activamente las rayas largas y los adornos retóricos que rompían el estilo corporativo. Sustituir eso por reglas concretas y verificables es lo que hizo que el estilo fuera consistente.
La alucinación a menudo se plantea como un defecto del modelo. En trabajo estructurado, suele ser en realidad un defecto del prompt: el prompt nunca le indicó al modelo qué hacer cuando falta un campo, así que hizo lo estadísticamente probable y produjo un valor plausible.
La solución es un protocolo de datos faltantes. Divide tus campos en obligatorios y opcionales. Los campos opcionales se omiten en silencio cuando están ausentes. Los campos obligatorios hacen lo contrario: si falta uno, el modelo debe detenerse y solicitarlo en un formato exacto en lugar de generar una nota. Esa única regla convierte una alucinación silenciosa en una solicitud de más datos visible y auditable. Es la diferencia entre una cifra errónea en un expediente regulado y una nota que nunca se produjo porque la entrada estaba incompleta.
Con un prompt endurecido, el propio agente debe quedar bloqueado para que nada reintroduzca variabilidad. Todo el flujo es deliberadamente mínimo: tres nodos y nada más.
Las decisiones de configuración que marcaron la diferencia:
Cada solución anterior queda anulada por un mal hábito: reutilizar el mismo chat. La regla operativa más importante para el equipo de analistas es iniciar una conversación nueva para cada caso, sin excepción. Nunca seguir revisando casos en la misma ventana. Esta es la regla que elimina la deriva de sesión —la causa raíz de la mayoría de los fallos originales— y no cuesta nada seguirla.
Si tu equipo está lidiando con un prompt que deriva dentro de una ventana de chat, la solución es un prompt endurecido ejecutándose en un agente sin estado. FlowHunt te permite bloquear el prompt, fijar el modelo y la temperatura, y ejecutar una llamada limpia por cada caso. Déjanos ayudarte a lograrlo.
Un método vale lo que valga su evidencia. Probamos nueve modelos frente al prompt endurecido, usando un caso real idéntico (un disparador de Intensidad de Juego con historial previo de duración de sesión) en tres ejecuciones por modelo —27 ejecuciones en total— y puntuamos cada ejecución frente a 16 criterios de cumplimiento.
En las 27 ejecuciones, ningún modelo listo para producción alucinó una cifra, invirtió la convención de pérdidas y ganancias, usó una raya larga o truncó la salida. El prompt endurecido eliminó todos los modos de fallo originales en los modelos que calificaron. Las diferencias que quedaron tenían que ver con la profundidad analítica y la consistencia, no con la corrección.
| Modelo | Proveedor | Puntuación media | Producción | Notas |
|---|---|---|---|---|
| GPT-5.6 Luna | OpenAI | 10 / 10 | Sí | Perfecto en las tres ejecuciones; máxima consistencia |
| Claude Fable 5 | Anthropic | 10 / 10 | Sí | Párrafos de resultado más razonados; mejor nota individual |
| Claude Sonnet 5 | Anthropic | 9.8 / 10 | Sí | Sin alucinaciones en ninguna ejecución; mejor Claude en general |
| Claude Opus 4.8 | Anthropic | 9.8 / 10 | Sí | Análisis más profundo; coste premium |
| GPT-5.4 Default | OpenAI | 9.5 / 10 | Sí | Un desliz de nomenclatura; mejor opción económica |
| Claude Sonnet 4.6 | Anthropic | 8.7 / 10 | No | Confundió el umbral del disparador con el límite de depósito en 2/3 ejecuciones |
| Claude Haiku 4.5 | Anthropic | 8.5 / 10 | No | Consistente pero con una justificación del resultado débil |
| Nivel más económico | Económico | 8.0 / 10 | No | Nombre exacto de la intervención solo en 1/3 ejecuciones |
| DeepSeek V4 Pro | DeepSeek | 7.8 / 10 | No | Salida truncada en la ejecución 1; inconsistente |
Las descalificaciones son instructivas. Claude Sonnet 4.6 produjo una prosa hermosa pero confundió el umbral del disparador con el límite de depósito, una cifra factualmente errónea en un expediente regulado, lo cual es descalificante sin importar lo bien que se lea. La oscilación de ejecución a ejecución de DeepSeek (6, 8.5, 9) es el verdadero problema: en trabajo regulado, la calidad que depende de la suerte no es calidad en absoluto.
Es tentador optimizar por precio, pero las cifras juegan en contra de esa idea. Incluso el modelo listo para producción más caro, Claude Opus 4.8, cuesta aproximadamente seis centavos por nota. Para un equipo que revisa 50 casos al día, eso supone menos de $90 al mes. El coste de un único hallazgo regulatorio derivado de una nota incorrecta empequeñecería el coste anual de cualquier modelo de la lista. Para el cumplimiento regulado, elige el modelo más fiable que puedas, no el más barato.
La mejor nota individual de las 27 ejecuciones vino de Claude Fable 5. Fíjate en lo que hace: expone la posición en la convención correcta, cita las cifras literalmente, usa el nombre exacto de la intervención y, de forma crucial, explica por qué escalar sería desproporcionado en lugar de limitarse a enunciar un resultado.
The customer is currently in a winning position of £1,612.50 with an account balance of £8,962.50, which represents an improvement on the winning position of £1,275.00 recorded at the previous review… Session duration was reviewed under Session Duration Level 1 on 19/07 and again on 20/07… Given that those decisions were made within the last few days, insufficient time has elapsed to assess their effectiveness, and repeating or escalating on the same behaviour at this stage would be disproportionate… In this context, No Further Action Required is the proportionate outcome.
Ese es el estándar que exige el trabajo regulado: basado en evidencia, proporcionado, e idéntico en calidad tanto en el primer caso del día como en el quincuagésimo.
El generador de notas de RG es un caso específico, pero el método se generaliza a cualquier proceso en el que un modelo de lenguaje deba producir un resultado fiable y repetible sobre datos regulados o de alto riesgo:
Haz esas cinco cosas y convertirás un modelo que alucina por la tarde en uno que produce un resultado listo para auditoría cada vez. La consistencia que exige el trabajo regulado es alcanzable: es un problema de arquitectura e ingeniería de prompts, y ambos son solucionables.
Arshia es ingeniera de flujos de trabajo de IA en FlowHunt. Con formación en ciencias de la computación y una pasión por la IA, se especializa en crear flujos de trabajo eficientes que integran herramientas de IA en las tareas cotidianas, mejorando la productividad y la creatividad.

Convierte un prompt de ChatGPT que deriva en un agente bloqueado y sin estado que produce notas listas para auditoría cada vez. Te ayudamos a endurecer el prompt y a elegir el modelo adecuado.

El jailbreaking de chatbots de IA evita las barreras de seguridad para hacer que el modelo se comporte fuera de sus límites previstos. Aprende las técnicas más ...

Una auditoría de seguridad de chatbots de IA es una evaluación estructurada y completa de la postura de seguridad de un chatbot de IA, que prueba vulnerabilidad...

Descubre los métodos más efectivos y fáciles de usar para conectar ChatGPT a tus propios datos, incluyendo conectores integrados, GPTs personalizados y la plata...
Consentimiento de Cookies
Usamos cookies para mejorar tu experiencia de navegación y analizar nuestro tráfico. See our privacy policy.