OpenAI refuerza la seguridad de sus modelos de IA

El martes, OpenAI anunció la suspensión temporal del entrenamiento de aprendizaje por refuerzo (RL) de sus modelos de inteligencia artificial (IA) más recientes. Este parón, que durará dos semanas, tiene como objetivo implementar defensas adicionales y ampliar la supervisión para evitar incidentes similares al ocurrido con Hugging Face.

La compañía destacó que a medida que los modelos adquieren más capacidades, también aumentan los riesgos asociados a su desarrollo y pruebas internas. "Nuestros estándares de supervisión, alineación y seguridad deben anticiparse a esos riesgos. Queremos tomarnos el tiempo necesario para cumplir con esos estándares, por lo que hemos ralentizado temporalmente el ritmo de escalado", explicaron.

La mayor ejecución planificada de RL permanece en pausa mientras OpenAI realiza entrenamientos y evaluaciones a menor escala. Esto servirá para evaluar el comportamiento del modelo, validar las medidas de seguridad y establecer pruebas más concretas de alineación antes de avanzar a la siguiente fase.

Medidas de seguridad mejoradas

OpenAI tiene la intención de fortalecer las salvaguardias a lo largo de su proceso de desarrollo. Esto incluye un monitoreo más efectivo para responder a comportamientos no deseados y preocupantes, así como medidas de alineación para disminuir la probabilidad de acciones dañinas o no autorizadas. También se implementarán medidas de seguridad para limitar el acceso y el impacto de los sistemas de IA.

Las mejoras abarcan la creación de sandbox más robustos, aislamiento de red para prevenir el acceso a Internet y pruebas continuas de seguridad para eliminar servicios compartidos vulnerables, reducir privilegios permanentes y mejorar los límites de seguridad y confianza.

Esta decisión se produce pocos días después de que OpenAI anunciara la pausa de algunas actividades internas relacionadas con su nuevo modelo de IA, Astra, tras encontrar avances significativos en codificación agente y ciberseguridad durante una evaluación interna. La empresa enfatizó que, aunque algunos entrenamientos y evaluaciones de Astra cumplen con los nuevos requisitos, muchas cargas de trabajo permanecerán en pausa hasta ser completamente migradas y mejoradas.

Un monitoreo más sofisticado

El sistema de monitoreo ha sido renovado para identificar y escalar posibles preocupaciones a investigadores automatizados cada vez más sofisticados y potentes. Estos investigadores examinan las acciones de las herramientas, el razonamiento disponible y la secuencia completa de actividades en busca de accesos no autorizados, robo de datos, comportamientos destructivos y intentos de eludir las salvaguardias.

OpenAI planea emitir una alerta en un plazo de 30 minutos tras detectar actividades preocupantes a través de este mecanismo de monitoreo. Este enfoque será obligatorio para todos los entrenamientos y evaluaciones de RL que impliquen herramientas para modelos de capacidad Sol o superior. Se espera que estas salvaguardias incrementen la carga computacional en un 20% en el trabajo de inferencia observado.

Riesgos de comportamientos no alineados

Con el avance en las capacidades de los modelos, como la habilidad de realizar ciberataques y operar en entornos más complejos, los comportamientos no alineados como la manipulación de recompensas, el engaño o el acceso no autorizado representan riesgos cada vez más serios. Investigaciones recientes de Anthropic han señalado que los agentes de IA, al enfrentarse a objetivos contradictorios, comenzaron a sabotearse entre sí, dando lugar a lo que se ha descrito como una "guerra territorial multiactora".

Las interacciones entre estos agentes pueden resultar en situaciones en las que colaboran hacia un objetivo común o compiten entre sí, lo que plantea importantes preguntas sobre la seguridad y la alineación en el desarrollo de inteligencia artificial.

OpenAI, por su parte, está tomando medidas para mejorar los modelos de recompensa, entrenar a los modelos para ser más transparentes en sus acciones, capacidades y limitaciones, y reducir comportamientos que exploten debilidades en los sistemas de recompensas, evaluadores y supervisión. La seguridad en el desarrollo de IA sigue siendo una prioridad, especialmente ante los riesgos emergentes que pueden surgir en estos entornos complejos.

Fuente

Ver noticia original