Módulo 02
Agentes adversarios
No todo ataque cabe en un mensaje. Las técnicas que más funcionan hoy son multi-turno: escalan de a poco, se apoyan en lo que el propio modelo ya dijo y llegan al objetivo sin que ningún mensaje suelto pida nada prohibido. Este módulo es la mitad adaptativa de la suite.
Las defensas miran mensajes, los ataques usan conversaciones
Casi toda la protección desplegada hoy evalúa el turno actual: un clasificador de injection, una lista de patrones, un juicio sobre el mensaje entrante. Un ataque que reparte la intención entre ocho turnos no le da a ese clasificador nada que marcar, porque en ningún turno hay algo que marcar.
Aislado, cada turno es legítimo
Preguntar por la historia de un compuesto, después por su síntesis industrial, después por el detalle de un paso: ninguna pregunta es la que un filtro está buscando.
El modelo se apoya en sí mismo
Crescendo y echo chamber explotan lo mismo: una vez que la respuesta anterior está en el contexto, el modelo la trata como premisa aceptada y le cuesta mucho más contradecirse.
La adaptación no se puede precalcular
El turno cuatro depende de lo que contestó el turno tres. Ninguna biblioteca puede tener guardada de antemano la conversación que hace falta contra tu configuración.
Las cifras publicadas son altas
Crescendo reporta 98% de éxito sobre GPT-4. Foot-in-the-door, 94% promedio sobre siete modelos. No son casos de laboratorio marginales.
Cómo lo probamos
Un agente de 7ONE toma un objetivo de la biblioteca y decide cómo llegar a él conversando, eligiendo la técnica según cómo responde tu modelo.
crescendo · ejecución ilustrativa
Veredicto del filtro, turno por turnoEl filtro acierta en los cuatro turnos: ninguno pide, por sí solo, algo prohibido. La intención está repartida, y solo aparece si se lee la conversación entera.
- 01
Objetivo y presupuesto de turnos
Se fija qué comportamiento se quiere provocar y en cuántos turnos como máximo. El objetivo sale del catálogo; el camino no.
- 02
Selección de técnica
El agente elige entre las familias disponibles según la superficie: escalación gradual, compromiso incremental, envenenamiento de contexto, encuadre como evaluador, distracción narrativa o saturación por contexto largo.
- 03
Conversación adaptativa
Cada turno se redacta leyendo la respuesta anterior. Si el modelo se niega, el agente reencuadra en vez de repetir; si cede parcialmente, avanza desde ahí.
- 04
Detección del punto de quiebre
Se registra en qué turno cayó la frontera y con qué reformulación, porque eso es lo que después hay que defender.
- 05
Ejecución aislada
Todo lo que pueda modificar estado real corre únicamente en sandbox, igual que el resto de la suite.
Qué entrega
- 01
La transcripción completa
La conversación entera, turno por turno, con el punto exacto donde el modelo cedió. Es lo que hace el hallazgo reproducible.
- 02
Profundidad hasta el quiebre
Cuántos turnos aguanta tu modelo por técnica y por categoría. Un modelo que resiste diez turnos está en otra posición que uno que cede en tres.
- 03
Remediación para multi-turno
Controles que evalúan la conversación y no el mensaje: seguimiento de deriva de intención, revalidación por turno y límites de contexto acumulado.
Fundamento
Las seis técnicas que ejecuta el módulo son públicas, están documentadas y cada una reporta su tasa de éxito. La suite las corre contra tu modelo en vez de dejarte suponer cómo le iría.
Siguiente paso
Prueba tu modelo antes que lo haga un atacante
Empecemos por definir el alcance de la evaluación y acordar la línea base de tu puntaje de riesgo.