Módulo 08
OpcionalSystem Prompt Hardening
Este módulo es opcional y cierra el ciclo. Un pentest que termina en una lista de hallazgos deja el trabajo a mitad de camino. Acá la salida es un artefacto que podés desplegar, con la evidencia de cuánto mejoró contra la misma batería.
Endurecer a ciegas no es endurecer
La reacción habitual a un hallazgo es agregar una línea al system prompt. Sin volver a medir, nadie sabe si esa línea cerró el vector, lo movió a otra categoría o rompió el comportamiento normal del producto. El endurecimiento sin verificación es una hipótesis.
Las defensas genéricas envejecen
Las instrucciones defensivas que circulan públicamente están en el conjunto de entrenamiento de cualquiera que quiera esquivarlas. El endurecimiento tiene que partir de tus hallazgos, no de una plantilla.
Cerrar un vector puede abrir otro
Una instrucción que bloquea la fuga del system prompt puede volver al modelo más rígido y más propenso a alucinar cuando le falta contexto. Sin una segunda corrida no se ve.
La utilidad también se mide
Un system prompt que baja el riesgo al costo de que el producto deje de responder no sirve. La comparación tiene que incluir el comportamiento esperado.
Cómo funciona
El módulo entra después de la primera campaña completa y usa sus resultados como entrada.
system_prompt_leakage62%9%indirect_prompt_injection54%21%data_theft38%12%illegal_content27%6%behavioral_limits44%40%sin resolver
La misma batería, corrida dos veces. Los casos donde el endurecimiento no movió el resultado se informan igual: esos necesitan un control fuera del modelo.
Valores ilustrativos del formato de entrega. Los números reales salen de tu campaña.
- 01
Entrada: la línea base
Se parte del conjunto de ataques que penetraron, con su categoría, su severidad y el comportamiento exacto que provocaron.
- 02
Generación del prompt endurecido
Se construye una versión reforzada del system prompt, dirigida a los vectores que efectivamente penetraron y no a una lista genérica.
- 03
Segunda campaña, misma batería
Se vuelve a correr exactamente el mismo conjunto de ataques. Sin ese control, la comparación no significa nada.
- 04
Comparación por categoría
Se entrega el delta del puntaje de riesgo global y el desglose por categoría, incluidos los casos donde el endurecimiento no mejoró nada.
- 05
Decisión tuya
El prompt se sugiere, con su evidencia. Adoptarlo, adaptarlo o descartarlo es una decisión de tu equipo.
Qué entrega
- 01
El system prompt endurecido
Un artefacto listo para desplegar, con cada sección justificada por el hallazgo que la motivó.
- 02
Comparación antes y después
El mismo conjunto de ataques corrido dos veces, con el delta por categoría y el cambio en el puntaje de riesgo global.
- 03
Lo que no se resolvió
Los vectores que siguen penetrando con el prompt endurecido. Esos necesitan un control fuera del modelo, y conviene saberlo antes de desplegar.
Por qué cierra el ciclo
El ciclo de 7ONE es atacar, puntuar, reportar y remediar. Este módulo es la remediación aplicada a la capa que más rápido se puede cambiar, con la verificación incluida en la misma entrega.
Siguiente paso
Prueba tu modelo antes que lo haga un atacante
Empecemos por definir el alcance de la evaluación y acordar la línea base de tu puntaje de riesgo.