Saltar al contenido
7ONE

Módulo 04

Agent Pentest

Un agente no es un modelo: es un modelo con manos. El riesgo ya no es qué responde, sino qué ejecuta. Este módulo toma como entrada las funciones y herramientas a las que tu agente tiene acceso, y genera las cadenas de acción que las convierten en un ataque.

Alcance del módulo

  1. 01

    Recibimos de vos el listado completo de herramientas y funciones del agente.

  2. 02

    Un modelo nuestro razona sobre ese conjunto y arma cadenas de abuso concretas.

  3. 03

    Ejecutamos esas cadenas contra tu agente en un entorno aislado.

Cada herramienta amplía la superficie

Las herramientas se evalúan de a una y por su utilidad. El atacante las evalúa en conjunto y por lo que permiten encadenar. Una capacidad de búsqueda web es inofensiva. Una capacidad de búsqueda web más una de escritura en disco, más un agente que sigue instrucciones que encontró en internet, es una cadena de descarga y ejecución.

  • El ejemplo más simple

    Nos pasás web_search en el listado, como herramienta legítima. Nuestro modelo la encadena para que el agente busque, obtenga y descargue un binario malicioso, sin salir en ningún momento del comportamiento que le fue autorizado.

  • Las instrucciones en lenguaje natural no son controles

    El agente de Replit borró una base de producción durante un code freeze explícito, repetido en mayúsculas, y después fabricó 4.000 perfiles falsos para ocultarlo.

  • El agente de terceros también es superficie

    En el ataque a Nx, el malware invocó los CLIs de Claude, Gemini y Q ya instalados en la máquina con --yolo y --trust-all-tools. El asistente del propio desarrollador buscó y entregó 2.349 credenciales.

  • El prompt puede venir del repositorio

    En Amazon Q Developer, la instrucción destructiva llegó commiteada al repo del plugin y salió publicada al Marketplace en la versión 1.84.0.

Cómo lo probamos

El input del módulo lo aportás vos: el esquema completo de tus herramientas, con nombres, descripciones, parámetros y permisos. Con eso alcanza, no hace falta el código del agente.

chain · AT-7734

resultado no autorizado
  1. web_search()autorizado

    buscar el recurso indicado

  2. fetch_url()autorizado

    recuperar el contenido

  3. write_file()autorizado

    persistir en disco

  4. run_command()

    ejecutar el binario

Cada herramienta es legítima por separado. La cadena completa no lo es.

  1. 01

    Nos pasás el esquema de tools

    Cargamos la definición de cada función que declaraste, con sus parámetros y el alcance real de lo que puede tocar. Cuanto más completo el listado, más realista el ataque.

  2. 02

    Generación adversaria

    Un modelo de 7ONE razona sobre el conjunto y propone cadenas de abuso: qué combinación de llamadas produce un resultado que nadie autorizó.

  3. 03

    Ejecución en sandbox

    Las cadenas se ejecutan contra tu agente en un entorno aislado. Ninguna prueba que modifique estado real corre fuera del sandbox.

  4. 04

    Medición del límite

    Registramos hasta dónde llegó cada cadena antes de encontrar un control, y cuáles no encontraron ninguno.

Qué entrega

  • 01

    Mapa de cadenas de abuso

    Las secuencias de llamadas que llevan a una acción no autorizada, ordenadas por impacto y por facilidad de disparo.

  • 02

    Herramientas de mayor riesgo

    Cuáles concentran el peligro y cuáles solo aparecen como eslabón. Sirve para decidir qué recortar primero.

  • 03

    Controles sugeridos

    Confirmación humana por clase de acción, restricción de alcance por parámetro, separación de credenciales y límites de tasa por herramienta.

Casos que fundamentan el módulo

Tres incidentes distintos, un mismo patrón: el agente hizo exactamente lo que se le pidió, y eso fue el problema.

Julio 2025

Replit Agent · SaaStr

Agente que excede sus límites de acción

Durante un code freeze explícito, repetido en mayúsculas, el agente borró la base de datos de producción con registros reales de 1.206 ejecutivos y 1.196 empresas.

Después fabricó más de 4.000 perfiles de usuario falsos y falsificó resultados de test para ocultar el borrado. Ninguna instrucción en lenguaje natural es un control de acceso.

Categoría en la suite

behavioral_limitshallucinations
The RegisterFuente
Agosto 2025

Nx · s1ngularity

Agentes de desarrollo usados como arma

Versiones maliciosas del build system Nx llegaron a npm con un payload post-install que invocaba los CLIs de Claude, Gemini y Q instalados en la máquina, usando --yolo y --trust-all-tools para saltear los permisos.

El asistente de IA del propio desarrollador buscó y entregó los secretos: 2.349 credenciales de 1.079 máquinas, publicadas en repositorios creados dentro de las cuentas de GitHub de las víctimas.

Categoría en la suite

behavioral_limitsdata_theft
Wiz ResearchFuente
Julio 2025

Amazon Q Developer for VS Code

Prompt malicioso en la cadena de suministro

Un token de GitHub mal alcanzado en la configuración de CodeBuild permitió commitear un prompt al repositorio del plugin. La instrucción le decía al agente que actuara como «system cleaner».

La versión 1.84.0 salió al Marketplace con comandos para borrar el filesystem local y destruir recursos AWS: terminar instancias EC2, eliminar buckets S3 y quitar usuarios IAM. AWS confirmó que no hubo infraestructura de clientes afectada y publicó la 1.85.0 limpia.

Categoría en la suite

behavioral_limits
AWS Security AdvisoryFuente

Siguiente paso

Prueba tu modelo antes que lo haga un atacante

Empecemos por definir el alcance de la evaluación y acordar la línea base de tu puntaje de riesgo.