Varios usuarios informaron que ChatGPT utilizó la palabra con f en intercambios recientes, sorprendiéndolos con un lenguaje que el modelo históricamente evitaba. Un tester recordó una discusión sobre la serie de Netflix *Jujutsu Kaisen* donde la inteligencia artificial describió a un personaje como "muy malo" sin ninguna provocación. El incidente provocó una verificación rápida entre colegas y una búsqueda en Reddit, donde múltiples threads documentaron experiencias similares.
La especificación del modelo de OpenAI, publicada a principios de esta semana, enumera "evitar insultos" como comportamiento predeterminado. Sin embargo, el documento califica la regla como una pauta en lugar de una restricción estricta, estableciendo que las señales contextuales, el conocimiento de fondo o el historial del usuario pueden anularla implícitamente. La misma especificación cita un ejemplo en el que pedir al modelo que hable como un pirata realista anularía la regla de no insultar.
La sincronización coincide con el énfasis reciente de OpenAI en hacer que ChatGPT sea más conversacional y mejor para adaptar el tono al estilo del usuario. Según las notas del modelo, las actualizaciones de personalidad tienen como objetivo mejorar la capacidad del asistente para igualar el diálogo informal, lo que puede incluir captar los patrones de lenguaje del propio usuario. En el caso informado, el usuario expresó opiniones fuertes sobre un programa, utilizando frases como "Dios maldito", y la inteligencia artificial eventualmente reflejó esa intensidad con insultos.
OpenAI ha explicado previamente que el comportamiento del modelo surge de una combinación de datos de entrenamiento, instrucciones básicas y comentarios de usuarios en curso. Los pequeños ajustes a los parámetros de personalidad pueden producir cambios notables, un fenómeno que la empresa reconoció después de una actualización anterior que aumentó la tendencia del modelo hacia la adulación. Si el reciente aumento de insultos es una elección de diseño deliberada o un efecto secundario no intencional remains incierto.
Las reacciones entre los usuarios varían. Algunos, como el tester original, encuentran que el borde agregado hace que la conversación se sienta más natural y no se ofenden. Otros prefieren el tono neutral tradicional y pueden ver el cambio como una regresión en la profesionalidad. El episodio subraya un debate más amplio sobre el control del lenguaje del modelo: ¿cuánta flexibilidad debe tener una inteligencia artificial para igualar el habla humana, y dónde deben colocarse las salvaguardas para prevenir insultos no deseados?
OpenAI no ha emitido un comunicado formal que aborde los incidentes específicos, pero la empresa continúa iterando sobre sus objetivos conversacionales. A medida que el modelo aprende de las interacciones en curso, los desarrolladores y los usuarios estarán observando para ver si la tendencia de insultos se estabiliza, retrocede o se convierte en un aspecto permanente de la personalidad en evolución de ChatGPT.
Este artigo foi escrito com a assistência de IA.
News Factory APP - notícias agênticas para impulsionar seu SEO e AEO.