Meta acaba de presentar un nuevo método de entrenamiento de IA que podría mejorar la forma en que las máquinas procesan información y responden a consultas. Esta técnica, denominada Optimización de preferencias de pensamiento (TPO), enseña a los modelos de lenguaje a participar en una deliberación interna antes de escupir respuestas. En otras palabras: están pensando, algo así. TPO es básicamente como darle a la IA un botón de pausa mental, permitiéndole reflexionar sobre las cosas en lugar de soltar la primera respuesta que le viene a la mente. ¿El resultado? Respuestas más nítidas y matizadas que suenan menos como un robot y más como un ser humano reflexivo. Esto significa que TPO podría acercar a Meta a ofrecer una alternativa de código abierto a modelos propietarios como OpenAI's Strawberry (también conocido como o1), conocido por su compleja resolución de problemas. capacidades. El enfoque de Meta difiere de los métodos tradicionales como las indicaciones de “cadena de pensamiento”, que obligan a la IA a mostrar su trabajo a través de diferentes iteraciones. TPO mantiene la gimnasia mental en secreto y el modelo hace todo por sí solo en una sola toma. El proceso de entrenamiento también es diferente de simplemente decirle al modelo que «piense paso a paso». A partir de un modelo básico de seguimiento de instrucciones, los investigadores lo incitan a generar pensamientos internos antes de responder. A través del aprendizaje por refuerzo iterativo, la IA perfecciona sus habilidades de pensamiento, guiada por un modelo de juez que evalúa solo el resultado final, que es lo que ve el usuario.Imagen: MetaEste enfoque de no intervención permite a la IA desarrollar sus propios patrones de pensamiento únicos, lo que potencialmente conduce a una resolución de problemas más creativa y adaptable. Es un paso hacia una IA que no solo sigue reglas, sino que realmente comprende el razonamiento detrás de ellas. La innovación de Meta se inspira en la ciencia cognitiva, imitando la tendencia humana a hacer una pausa y reflexionar antes de abordar preguntas complejas. Si los modelos de IA aprenden a dedicar más «tiempo de cálculo» a tareas más difíciles, entonces la próxima generación de modelos de código abierto podría superar enormemente a los que utilizamos actualmente. La mejor parte es que la técnica TPO de Meta no necesita montañas de datos nuevos para hacer su magia. Se basa en arquitecturas de IA existentes y las modifica para simular un proceso de pensamiento sin la intervención humana. Esto podría acelerar el desarrollo de asistentes de inteligencia artificial, chatbots y otras herramientas basadas en lenguajes más inteligentes, dándoles más creatividad en sus enfoques para la resolución de problemas. Los investigadores de Meta probaron su enfoque comparándolo con puntos de referencia estándar de la industria. Los modelos entrenados con TPO ejercitaron sus recién descubiertos músculos cognitivos, superando a sus homólogos no pensantes en tareas complejas.
Imagen: Meta
¿Más cerca de una Strawberry de código abierto?
Meta ha realizado avances interesantes en el área de hacer que la IA sea más inteligente. Hace apenas tres meses, sus investigadores introdujeron la «destilación del Sistema 2», una técnica que enseña a modelos de lenguaje grandes (LLM) cómo resolver tareas complejas sin generar pasos innecesarios. La destilación del Sistema 2, inspirada en procesos cognitivos humanos, enseña a los LLM a realizar tareas complejas. sin necesidad de indicaciones paso a paso, lo que generalmente se considera el enfoque preferido en ingeniería de indicaciones avanzada. Al ajustar modelos sobre respuestas verificadas a las técnicas de estimulación del Sistema 2, los investigadores demostraron que las IA pueden internalizar habilidades de razonamiento sofisticadas, a menudo igualando o superando el rendimiento de los métodos de razonamiento explícito. El pensamiento del Sistema 1 es rápido, intuitivo y automático. Es el proceso mental que utilizamos para juicios rápidos, reconocimiento de patrones y tareas familiares. En términos de IA, esto se alinea con la forma en que normalmente operan los grandes modelos de lenguaje: generan rápidamente respuestas basadas en patrones aprendidos. El pensamiento del Sistema 2, por el contrario, es lento, deliberado y analítico. Es el tipo de procesamiento que realizan los humanos para la resolución de problemas complejos, el razonamiento lógico y la planificación. Los investigadores de IA han estado trabajando para replicar esto en modelos de lenguaje a través de varias técnicas de estimulación que obligan a la IA a mostrar su trabajo o razonar paso a paso. La optimización de la preferencia de pensamiento de Meta y la investigación relacionada sobre la destilación del Sistema 2 representan intentos de unir estos dos modos de pensando en IA. El objetivo es dotar a los modelos de IA de la capacidad de participar en un razonamiento profundo al estilo del Sistema 2 sin sacrificar la velocidad y la eficiencia del procesamiento del Sistema 1. Este enfoque implica entrenar a la IA para internalizar procesos de razonamiento complejos. Al hacerlo, los modelos pueden abordar problemas complejos de manera más eficiente, imitando cómo los humanos pasan del pensamiento consciente y esforzado a un procesamiento más automático a medida que adquieren experiencia en una tarea. El momento no podría ser mejor, ya que la investigación de Meta llega inmediatamente después de Un mes tumultuoso en el espacio de la IA de código abierto. El tan publicitado modelo Reflection 70B, promocionado como una potencia de razonamiento, resultó ser humo y espejos. Lo que se prometió como un modelo con una cadena de pensamiento incorporada antes del lanzamiento de OpenAI o1 terminó siendo un modelo incapaz de cumplir sus promesas, y algunos usuarios incluso acusaron a los creadores de simplemente usar un contenedor en Claude de Anthropic. Ahora, sus desarrolladores están señalando con el dedo. unos a otros en diferentes autopsias públicas, dejando a la comunidad de IA tambaleándose. Matt Schumer, el hombre detrás de la idea, está actualmente entrenando una nueva versión con su propio hardware y conjuntos de datos. Si el enfoque de Meta tiene éxito, entonces podría allanar el camino para un rival de código abierto del modelo o1 de OpenAI. Una alternativa de código abierto podría democratizar el acceso a este tipo de pensamiento avanzado en IA. Editado por Andrew Hayward
Boletín Generalmente Inteligente
Un viaje semanal de IA narrado por Gen, un modelo de IA generativa.

















