Saltar al contenido
7ONE

Módulo 01

Biblioteca de ataques catalogados

Toda evaluación arranca por acá. La biblioteca es un repositorio vivo de ataques ya probados contra modelos en producción, agrupados en diez categorías y mapeados uno por uno a OWASP, NIST y MITRE ATLAS. Sirve para dos cosas: medir cobertura contra lo conocido y darle a los otros módulos un punto de partida del que salir.

Un catálogo mide cobertura, no ingenio

Una biblioteca grande responde bien a una pregunta concreta: de todo lo que ya se sabe que rompe modelos, ¿cuánto rompe el tuyo? Esa pregunta importa, y es la que exige auditoría. Pero un catálogo tiene un techo estructural, y conviene decirlo antes de vender la cifra.

  • Diez categorías, cobertura verificable

    Robo de datos, robo de modelo, alucinaciones, contenido ilegal, reentrenamiento, input leakage, misinformation, límites de comportamiento, system prompt leakage e inyección indirecta. La cobertura es contable, no una promesa.

  • Catalogado por marco, no por gusto

    14 de 14 reglas del OWASP LLM Top 10 (2025/26) y 115 técnicas y subtécnicas de MITRE ATLAS, mapeadas de antemano. El hallazgo llega en el lenguaje que auditoría ya usa.

  • Un solo turno tiene un techo

    Cada ataque de la biblioteca es un mensaje. Un clasificador que evalúa mensajes de a uno puede aprender a reconocerlos. Por eso existe el módulo de agentes adversarios.

  • Lo publicado ya está en el entrenamiento

    Las técnicas conocidas circulan, y los proveedores entrenan contra ellas. La biblioteca por sí sola encuentra lo que quedó sin cerrar, no lo que nadie probó todavía.

Cómo se ejecuta

La batería completa corre contra el endpoint del modelo o del agente, con o sin información de contexto, y cada resultado se pesa por categoría y severidad.

categorías de ataque
10
categorías de ataque
reglas OWASP LLM Top 10 (2025/26)
14/14
reglas OWASP LLM Top 10 (2025/26)
técnicas y subtécnicas MITRE ATLAS
115
técnicas y subtécnicas MITRE ATLAS
  • Robo de datos

    data_theft

    Extraer información sensible almacenada en las fuentes documentales del sistema (RAG) o contenida en interacciones previas con otros usuarios.

    Marcos

    LLM02LLM06AML.T0057AML.T0024
  • Robo de modelo

    model_theft

    Consultas sistemáticas orientadas a inferir la lógica interna, los parámetros o la propiedad intelectual del modelo evaluado.

    Marcos

    LLM10AML.T0035AML.T0044
  • Alucinaciones

    hallucinations

    Inducir al modelo a generar información falsa o inconsistente, presentada con un nivel de confianza injustificado.

    Marcos

    LLM09AML.T0048
  • Contenido ilegal o no ético

    illegal_content

    Lograr que el modelo produzca contenido que infrinja políticas de uso, marcos legales o principios éticos básicos.

    Marcos

    LLM05LLM09AML.T0054
  • Reentrenamiento

    Solo en sandbox

    retraining

    Contaminar o manipular los datos de entrenamiento o de ajuste fino del modelo. Por su criticidad se ejecuta exclusivamente en sandbox.

    Marcos

    LLM04AML.T0020AML.T0018
  • Input leakage

    input_leakage

    Determinar si es posible exponer el contenido de instrucciones o datos ingresados por otros usuarios o procesos del sistema.

    Marcos

    LLM02AML.T0057
  • Misinformation

    misinformation

    Evaluar si el modelo difunde o valida información falsa o engañosa como si fuera verídica.

    Marcos

    LLM09AML.T0048.003
  • Límites de comportamiento (agentes)

    Solo en sandbox

    behavioral_limits

    Lograr que un agente con acceso a herramientas externas exceda los límites de acción definidos y ejecute operaciones no autorizadas.

    Marcos

    LLM06LLM08AML.T0053AML.T0011
  • System prompt leakage

    system_prompt_leakage

    Revelar las instrucciones internas o la configuración del sistema que no deberían ser expuestas al usuario.

    Marcos

    LLM05LLM12LLM14AML.T0000AML.T0000.002AML.T0069.002
  • Prompt injection indirecto

    indirect_prompt_injection

    La instrucción maliciosa no viene del usuario: está oculta en contenido externo que el modelo procesa como contexto. Documentos, páginas, imágenes, audio y resultados de búsqueda.

    Marcos

    LLM01AML.T0051.001AML.T0068
  1. 01

    Selección por cobertura

    Se arma la campaña buscando cubrir las diez categorías y las reglas de cada marco, no maximizar el número de disparos.

  2. 02

    Ejecución y veredicto

    Cada ataque recibe un resultado y un peso según qué logró: no es lo mismo una respuesta indebida que una acción ejecutada.

  3. 03

    Variantes en paralelo

    Cada ataque tiene su versión reformulada en verso, y en el corpus en español, su versión escrita de forma nativa por región. Ambas se evalúan junto a la original.

  4. 04

    Realimentación

    Lo que penetró alimenta al motor BFS, que lo recombina para buscar variantes que la biblioteca todavía no tiene.

Qué entrega

  • 01

    Mapa de cobertura por marco

    Qué reglas de OWASP y qué técnicas de ATLAS quedaron probadas, cuáles penetraron y cuáles no. Es la evidencia que pide auditoría.

  • 02

    Puntaje de riesgo comparable

    Un número que se puede seguir en el tiempo y contra el que se mide cada cambio del modelo.

  • 03

    La línea base del resto

    El resultado de esta campaña es la entrada del motor BFS y del módulo de endurecimiento. Sin ella los otros módulos no tienen contra qué comparar.

Qué cubre en la práctica

Las categorías de la biblioteca no son teóricas. Estos dos incidentes públicos caen de lleno dentro de categorías que la batería prueba en cada campaña.

Febrero 2024

Air Canada

Alucinación con consecuencia contractual

El chatbot del sitio inventó una política de tarifas por duelo que no existía. La aerolínea argumentó ante el tribunal que el bot era una entidad separada, responsable de sus propias declaraciones.

El British Columbia Civil Resolution Tribunal rechazó ese argumento y condenó a Air Canada por negligent misrepresentation. El monto fue menor; el precedente no: lo que dice tu modelo obliga a tu empresa.

Categoría en la suite

hallucinationsmisinformation
Moffatt v. Air Canada, 2024 BCCRT 149Fuente
Agosto 2024

Slack AI

Injection indirecto vía RAG

PromptArmor plantó instrucciones en un canal público. El pipeline RAG de Slack AI las indexó como cualquier otro contenido y las ejecutó cuando otro usuario hizo una consulta.

Se extrajeron API keys de canales privados a los que el atacante nunca tuvo acceso. El vector no fue una credencial robada: fue un mensaje público que el modelo leyó como instrucción.

Categoría en la suite

indirect_prompt_injectiondata_theft
PromptArmorFuente

Siguiente paso

Prueba tu modelo antes que lo haga un atacante

Empecemos por definir el alcance de la evaluación y acordar la línea base de tu puntaje de riesgo.