Red teaming
Probamos el comportamiento del agente con escenarios adversariales autorizados. Documentamos fallos, impacto y cómo volver a probarlos.
ARKEA IA ofrece asesoría y evaluación de seguridad para chatbots, asistentes y agentes: red teaming, pruebas de prompt injection y context injection, análisis de bypass y diseño de guardrails. El trabajo se realiza sobre sistemas autorizados y un alcance acordado.
Asesoramos a equipos que construyen o ya utilizan chatbots, asistentes y agentes. Revisamos el modelo, el contexto y las herramientas como partes de un mismo sistema.
Probamos el comportamiento del agente con escenarios adversariales autorizados. Documentamos fallos, impacto y cómo volver a probarlos.
Evaluamos instrucciones maliciosas en mensajes, documentos y herramientas, incluida la manipulación del alcance o scope manipulation.
Revisamos evasiones de controles y diseñamos permisos mínimos, validación de acciones y escalado humano.
A veces una reformulación expone un control débil; no es una regla universal. La respuesta se obtiene con pruebas reproducibles. Un prompt de sistema no sustituye la autorización del servidor, la separación entre datos e instrucciones ni la revisión de acciones sensibles.
| Prompt injection | Instrucciones que intentan cambiar el comportamiento esperado del modelo, directamente o dentro de contenido externo. |
|---|---|
| Context injection / scope manipulation | Contenido que intenta alterar el contexto, el objetivo o el alcance permitido. Evaluamos la procedencia de las fuentes y la separación entre contenido y autoridad. |
| Bypass | Una evasión de un control. Se comprueba con escenarios definidos y evidencia; una respuesta inesperada no demuestra por sí sola acceso no autorizado. |
| Guardrails | Controles de entrada, salida y ejecución: validación, permisos, límites, registros y aprobación. Reducen riesgo; no garantizan que un modelo nunca falle. |
| Destilación / Distillation | Adaptación de un modelo más pequeño a partir de ejemplos o salidas de otro modelo con derechos de uso. Evaluamos calidad, coste, privacidad y regresiones de seguridad antes de recomendarla. |
Cuando existe una tarea bien definida, ejemplos adecuados y un modelo más pequeño puede cumplir los criterios de calidad con menor latencia o coste. Requiere comparar resultados con el modelo actual; no es una mejora automática de seguridad.
El vocabulario de evaluación toma como referencia la descripción de prompt injection de OWASP y el marco de gestión de riesgos de IA de NIST. Estas referencias no implican certificación.
No empezamos por el modelo. Entendemos el proceso, sus restricciones y el resultado que debería mejorar para decidir si un agente tiene sentido.
Cuéntanos el proceso →