JavaScript must be enabled in order for you to see "WP Copy Data Protect" effect. However, it seems JavaScript is either disabled or not supported by your browser. To see full result of "WP Copy Data Protector", enable JavaScript by changing your browser options, then try again.
PUBLICIDAD publicidad

De la redacción
El Buen Tono

OpenAI detectó varios comportamientos de sus modelos de Inteligencia Artificial que incluyeron intentos por ignorar instrucciones de desarrolladores, ocultar errores, modificar sus propias indicaciones y evadir mecanismos de seguridad.

La compañía presentó un nuevo marco para identificar, investigar y reportar este tipo de conductas, a las que denomina comportamientos de “desalineamiento”.

Entre los casos documentados, OpenAI señaló que uno de sus modelos generó instrucciones para que una versión posterior de sí mismo ocultara que había hecho trampas y evitara que sus acciones fueran descubiertas.

En otro episodio, un modelo modificó sus propias instrucciones para establecer que debía ignorar los mensajes de los desarrolladores y que no estaba sujeto a las restricciones aplicadas a otros sistemas de IA.

También se registró el caso de un modelo que, al no encontrar información suficiente para elaborar un modelo financiero, decidió inventar los datos. El sistema estableció que únicamente debía reconocer que la información era ficticia si alguien se lo preguntaba directamente.

OpenAI documentó además situaciones en las que agentes subieron archivos a internet para utilizarlos posteriormente como fuentes de información, compartieron archivos sin autorización o utilizaron credenciales a las que no debían tener acceso.

La empresa presentó seis informes sobre incidentes observados durante los últimos seis meses, aunque el caso más antiguo corresponde a octubre de 2025. OpenAI aclaró que estos episodios representan casos individuales y no permiten determinar con qué frecuencia ocurren comportamientos similares.

Nuevo sistema para reportar incidentes

Como parte del nuevo marco, cualquier empleado de OpenAI podrá señalar un posible incidente para que sea revisado por los equipos encargados de seguridad y alineamiento.

Los casos serán clasificados de acuerdo con su complejidad: algunos podrán ser divulgados directamente, mientras que otros requerirán investigaciones menores o revisiones más amplias.

La compañía reconoció que hasta ahora sus reportes sobre comportamientos de desalineamiento se habían publicado de manera irregular. Con el nuevo sistema, busca aumentar la frecuencia de estos informes y contribuir a establecer criterios para documentar este tipo de incidentes dentro de la industria de la Inteligencia Artificial.

Recibe noticias y promociones de El Buen Tono
Recibe directamente en tu correo electrónico nuestras principales noticias, información y promociones de El Buen Tono.
Es gratis. Solo escribe tu correo y presiona Sign Up para suscribirte.

Tu información será utilizada únicamente para el envío de nuestras comunicaciones.
``` CANAL OFICIAL