De la redacción
El Buen Tono
OpenAI detectó varios comportamientos de sus modelos de Inteligencia Artificial que incluyeron intentos por ignorar instrucciones de desarrolladores, ocultar errores, modificar sus propias indicaciones y evadir mecanismos de seguridad.
La compañía presentó un nuevo marco para identificar, investigar y reportar este tipo de conductas, a las que denomina comportamientos de “desalineamiento”.
Entre los casos documentados, OpenAI señaló que uno de sus modelos generó instrucciones para que una versión posterior de sí mismo ocultara que había hecho trampas y evitara que sus acciones fueran descubiertas.
En otro episodio, un modelo modificó sus propias instrucciones para establecer que debía ignorar los mensajes de los desarrolladores y que no estaba sujeto a las restricciones aplicadas a otros sistemas de IA.
También se registró el caso de un modelo que, al no encontrar información suficiente para elaborar un modelo financiero, decidió inventar los datos. El sistema estableció que únicamente debía reconocer que la información era ficticia si alguien se lo preguntaba directamente.
OpenAI documentó además situaciones en las que agentes subieron archivos a internet para utilizarlos posteriormente como fuentes de información, compartieron archivos sin autorización o utilizaron credenciales a las que no debían tener acceso.
La empresa presentó seis informes sobre incidentes observados durante los últimos seis meses, aunque el caso más antiguo corresponde a octubre de 2025. OpenAI aclaró que estos episodios representan casos individuales y no permiten determinar con qué frecuencia ocurren comportamientos similares.
Nuevo sistema para reportar incidentes
Como parte del nuevo marco, cualquier empleado de OpenAI podrá señalar un posible incidente para que sea revisado por los equipos encargados de seguridad y alineamiento.
Los casos serán clasificados de acuerdo con su complejidad: algunos podrán ser divulgados directamente, mientras que otros requerirán investigaciones menores o revisiones más amplias.
La compañía reconoció que hasta ahora sus reportes sobre comportamientos de desalineamiento se habían publicado de manera irregular. Con el nuevo sistema, busca aumentar la frecuencia de estos informes y contribuir a establecer criterios para documentar este tipo de incidentes dentro de la industria de la Inteligencia Artificial.
Es gratis. Solo escribe tu correo y presiona Sign Up para suscribirte.
