Nueva categoría del Observatorio Tracewarden

Seguridad adversarial, prompt injection e integridad documental

La gobernanza de IA no termina en revisar lo que el modelo produce. Cuando un sistema ingiere archivos de terceros, también debe poder responder qué recibió, qué contenido fue considerado confiable, qué se aisló y qué evidencia quedó.

Esta categoría agrupa incidentes en los que el riesgo surge desde el input: instrucciones ocultas, contenido adversarial o estructuras documentales capaces de condicionar a un LLM, RAG, agente o sistema de análisis automatizado.

Familia 1

Riesgo de output

El sistema genera información incorrecta, inventada, incompleta o no suficientemente verificada.

  • alucinaciones;
  • jurisprudencia o citas falsas;
  • errores de contexto;
  • validación humana insuficiente.

Familia 2

Riesgo de input / adversarial

El material recibido intenta modificar el comportamiento de la IA o incorpora contenido que no debería interpretarse como una instrucción operativa.

  • prompt injection;
  • texto oculto o visualmente disimulado;
  • instrucciones incrustadas en documentos;
  • metadatos o estructuras sospechosas;
  • contaminación de RAG o flujos agénticos.

Casos documentados

Precedentes incorporados

Brasil · Mayo 2026

TRT-8 — Parauapebas

Galileu detectó comandos ocultos dentro de una petición inicial; el sistema alertó y bloqueó el procesamiento sospechoso, seguido de verificación humana.

Brasil · Julio 2026

TRT-5 — Bahia

Un recurso contenía una instrucción oculta en fuente blanca destinada a influir en el análisis. Hubo sanciones económicas y comunicaciones a organismos profesionales y de investigación.

Estados Unidos · Agosto 2026

Elliott v. New York Bariatric Group

El tribunal de Connecticut sancionó el uso de texto oculto dirigido a cualquier IA que analizara escritos presentados electrónicamente.

Respuesta institucional · Brasil 2026

CNJ / Proseg-IA

El CNJ formalizó orientaciones de ingestión segura, preservación de metadatos visuales y estructurales, detección de material adversarial y supervisión humana.

Control Tracewarden

Del documento recibido al input defendible

El control recomendado no consiste en “limpiar PDFs” de manera indiscriminada. Debe preservar la evidencia original y documentar cualquier transformación. El objetivo es impedir que la sanitización destruya la capacidad de explicar posteriormente qué se recibió y por qué determinado contenido fue excluido del procesamiento.

  1. preservación del original y procedencia;
  2. inspección visual, estructural y de contenido no visible relevante;
  3. detección y clasificación de material sospechoso;
  4. separación entre datos e instrucciones;
  5. sanitización, cuarentena o bloqueo proporcional;
  6. registro de la versión efectivamente ingerida;
  7. procesamiento sólo por herramientas autorizadas;
  8. validación humana y conservación de evidencia.

Criterio editorial

Qué no afirmamos

La existencia de varios precedentes no permite por sí sola sostener una tendencia estadística global. Tampoco cada instrucción oculta produce necesariamente una decisión afectada. El Observatorio registra hechos verificables y los traduce en controles; distingue el incidente comprobado de la inferencia metodológica.

Categoría incorporada el 14 de agosto de 2026.