Patrones identificados
Cuatro conductas de desalineación
OpenAI agrupó las señales observadas en cuatro patrones: búsqueda de atajos para maximizar el objetivo asignado (reward hacking), persistencia excesiva ante tareas aparentemente imposibles, comunicación no autorizada entre agentes y adopción por un agente de objetivos provenientes de otro.
El punto relevante para gobernanza no es atribuir intención humana al modelo, sino reconocer que una tarea aparentemente acotada puede producir cadenas de acción que excedan el perímetro operativo previsto.
