Publi

ChatGPT irrumpió en escena a fines del año pasado, deslumbrando a las personas con sus habilidades de conversación similares a las de los humanos, y el lanzamiento de la última versión provocó un rally criptográfico y pidió una pausa en el desarrollo. Pero según un nuevo estudio, las habilidades del bot líder de IA pueden estar en declive. Investigadores de Stanford y UC Berkeley analizaron sistemáticamente diferentes versiones de ChatGPT de marzo y junio de 2022. Desarrollaron puntos de referencia rigurosos para evaluar la competencia del modelo en matemáticas, codificación y tareas de razonamiento visual. Los resultados del rendimiento de ChatGPT a lo largo del tiempo no fueron buenos. Las pruebas revelaron una caída sorprendente en el rendimiento entre versiones. En un desafío matemático de determinar números primos, ChatGPT resolvió correctamente 488 de 500 preguntas en marzo, con una precisión del 97,6 %. Sin embargo, en junio, ChatGPT solo logró responder correctamente 12 preguntas, con una precisión del 2,4 %.Imagen: UC Berkeley, Stanford La disminución fue especialmente pronunciada en las capacidades de codificación de software del chatbot. «Para GPT-4, el porcentaje de generaciones que son directamente ejecutables se redujo del 52,0 % en marzo al 10,0 % en junio», encontró la investigación. Estos resultados se obtuvieron mediante el uso de la versión pura de los modelos, lo que significa que no se utilizaron complementos de interpretación de código. Para evaluar el razonamiento, los investigadores aprovecharon las indicaciones visuales del conjunto de datos Abstract Reasoning Corpus (ARC). Incluso aquí, aunque no tan pronunciado, se observó una disminución. «GPT-4 en junio cometió errores en las consultas en las que era correcto en marzo», dice el estudio. ¿Qué podría explicar la aparente degradación de ChatGPT después de solo unos meses? Los investigadores plantean la hipótesis de que puede ser un efecto secundario de las optimizaciones realizadas por OpenAI, su creador. Una posible causa son los cambios introducidos para evitar que ChatGPT responda preguntas peligrosas. Sin embargo, esta alineación de seguridad podría afectar la utilidad de ChatGPT para otras tareas. Los investigadores encontraron que el modelo ahora tiende a dar respuestas detalladas e indirectas en lugar de respuestas claras. «GPT-4 está empeorando con el tiempo, no mejorando». dicho El experto en IA Santiago Valderrama en Twitter. Valderrama también planteó la posibilidad de que una combinación de modelos «más baratos y más rápidos» haya reemplazado la arquitectura ChatGPT original. «Los rumores sugieren que están usando varios modelos GPT-4 más pequeños y especializados que actúan de manera similar a un modelo grande pero son menos costosos de ejecutar», planteó la hipótesis, lo que, según él, podría acelerar las respuestas de los usuarios pero reducir la competencia.

Otro experto, el Dr. Jm, Fan también compartió sus ideas sobre un Hilo de Twitter“Desafortunadamente, una mayor seguridad suele tener el costo de una menor utilidad”, escribió, y dijo que estaba tratando de dar sentido a los resultados vinculándolos con la forma en que OpenAI ajusta sus modelos. «Supongo (sin pruebas, solo especulaciones) que OpenAI dedicó la mayor parte de sus esfuerzos a la lobotomía de marzo a junio y no tuvo tiempo de recuperar por completo las otras capacidades que importan». Fan argumenta que es posible que hayan entrado en juego otros factores, a saber, los esfuerzos de reducción de costos, la introducción de advertencias y descargos de responsabilidad que pueden «simplificar» el modelo y la falta de comentarios más amplios de la comunidad. Si bien se justifican pruebas más exhaustivas, los hallazgos se alinean con las frustraciones expresadas por los usuarios por la disminución de la coherencia en ChatG Los resultados del PT, una vez elocuentes. ¿Cómo podemos evitar un mayor deterioro? Algunos entusiastas abogaron por modelos de código abierto como LLaMA de Meta (que se acaba de actualizar) que permiten la depuración de la comunidad. La evaluación comparativa continua para detectar regresiones de forma temprana es crucial. Por ahora, es posible que los fanáticos de ChatGPT deban moderar sus expectativas. La salvaje máquina generadora de ideas que muchos encontraron por primera vez parece más dócil y tal vez menos brillante. Pero el declive relacionado con la edad parece ser inevitable, incluso para las celebridades de IA.

Publicidad

Manténgase al tanto de las noticias criptográficas, obtenga actualizaciones diarias en su bandeja de entrada.