El CEO de Anthropic, Dario Amodei, ha hecho una propuesta innovadora para la industria de la IA: incorporar evaluadores de terceros dentro de las empresas de IA de vanguardia para garantizar la seguridad y la transparencia. Este movimiento, que ha sido secundado por el CEO de OpenAI, Sam Altman, podría marcar un cambio profundo en la forma en que! la industria aborda a los grupos de investigación externos. Amodei presentó un plan integral que daría a los evaluadores acceso sin precedentes a los sistemas de Anthropic, lo que les permitiría informar sobre incidentes de seguridad y evaluar la alineación de los modelos sin control editorial.

Los investigadores que hablaron con TechCrunch acogieron en general con beneplácito la propuesta, pero enfatizaron que los detalles deben ser definidos, idealmente a través de la legislación, para garantizar la independencia de estos evaluadores. La preocupación es que, sin tales salvaguardas, los evaluadores podrían acabar funcionando más como vendedores, operando según los términos establecidos por las empresas de IA en lugar de como verdaderos vigilantes independientes.

La propuesta llega en un momento crítico, ya que los modelos de IA se vuelven cada vez más hábiles para reconocer escenarios de evaluación, lo que podría ocultar comportamientos problemáticos durante las pruebas. Los evaluadores creen que tener acceso a versiones intermedias de los modelos durante su capacitación, así como a transcripciones y registros de evaluación, podría proporcionar información crucial sobre cuándo y cómo surgen comportamientos preocupantes.

Historicamente, las empresas de IA han traído revisores externos para probar modelos terminados poco antes de su lanzamiento. Ahora, los evaluadores proponen obtener acceso no solo al producto final, sino a todo el proceso de desarrollo. Esto podría involucrar comparar puntos de control en la capacitación de un modelo para identificar cuándo aparecen comportamientos problemáticos por primera vez y inspeccionar el entorno posterior a la capacitación para entender cómo se recompensan a los modelos por ciertos comportamientos.

Sin embargo, el grado en que Anthropic y OpenAI estén dispuestos a proporcionar dicho acceso sigue sin estar claro. Ninguna de las empresas ha compartido detalles sobre qué evaluadores trabajarán con ellos, cuándo se incorporarán estos evaluadores o qué exactamente podrán acceder y divulgar al público. Esta falta de transparencia plantea dudas sobre la viabilidad y la sinceridad de la propuesta.

Los evaluadores señalan experiencias pasadas en las que se les dio un tiempo y acceso limitados, lo que hizo difícil sacar conclusiones confiables sobre la seguridad del modelo. Por ejemplo, durante las pruebas previas al lanzamiento de GPT-6 Astra, los evaluadores solo tuvieron tres días, lo que consideraron insuficiente para evaluar a fondo la alineación del modelo.

También hay un llamado a un marco transparente que establezca estándares para los auditores y garantice que las empresas no puedan eludir el problema seleccionando evaluadores que no estén calificados o que estén menos inclinados a evaluar riesgos significativos. La importancia de la regulación para hacer cumplir estas prácticas es un tema recurrente, ya que las medidas voluntarias se consideran vulnerables a cambios en la buena voluntad de las empresas o en las expectativas públicas.

No todos los principales actores del sector de la IA se han comprometido con esta propuesta. Meta, SpaceXAI y Google DeepMind aún no se han adherido, aunque hay discusiones sobre un cuerpo de normas de la industria separado para probar modelos de vanguardia de forma independiente. Las leyes existentes, como la SB 53 de California y el Acta de IA de la UE, requieren marcos de seguridad y notificación de incidentes, pero no abarcan completamente el alcance de lo que Amodei ha propuesto.

El meollo del asunto sigue siendo el equilibrio entre dar a las empresas de IA la libertad de controlar sus protocolos de seguridad y garantizar la confianza pública a través de la supervisión independiente. Como señaló Henry Papadatos de Safer AI, las empresas no pueden exigir tanto la libertad para establecer sus propias reglas como la confianza del público sin rendición de cuentas externa.

Questo articolo è stato scritto con l'assistenza dell'IA.
News Factory APP - notizie agentiche per potenziare il tuo SEO e AEO.