Los investigadores de DeepMind de Google han presentado un nuevo método para acelerar el entrenamiento de la IA, reduciendo significativamente los recursos computacionales y el tiempo necesarios para realizar el trabajo. Este nuevo enfoque para el proceso que normalmente consume mucha energía podría hacer que el desarrollo de la IA sea más rápido y más barato, según un artículo de investigación reciente, y eso podría ser una buena noticia para el medio ambiente. «Nuestro enfoque, el aprendizaje contrastivo multimodal con selección conjunta de ejemplos (JEST), supera los modelos de última generación con hasta 13 veces menos iteraciones y 10 veces menos computación», dijo el estudio. La industria de la IA es conocida por su alto consumo de energía. Los sistemas de IA a gran escala como ChatGPT requieren una gran potencia de procesamiento, lo que a su vez demanda mucha energía y agua para enfriar estos sistemas. El consumo de agua de Microsoft, por ejemplo, supuestamente aumentó un 34% entre 2021 y 2022 debido a las mayores demandas de computación de IA, y se acusa a ChatGPT de consumir casi medio litro de agua cada 5 a 50 indicaciones. La Agencia Internacional de Energía (AIE) proyecta que el consumo de electricidad del centro de datos se duplicará entre 2022 y 2026, estableciendo comparaciones entre las demandas de energía de la IA y el perfil energético a menudo criticado de la industria de la minería de criptomonedas.Sin embargo, enfoques como JEST podrían ofrecer una solución. Al optimizar la selección de datos para el entrenamiento de IA, afirmó Google, JEST puede reducir significativamente la cantidad de iteraciones y la potencia computacional necesarias, lo que podría reducir el consumo total de energía. Este método se alinea con los esfuerzos por mejorar la eficiencia de las tecnologías de IA y mitigar su impacto ambiental. Si la técnica demuestra ser efectiva a gran escala, los entrenadores de IA necesitarán solo una fracción de la energía utilizada para entrenar sus modelos. Esto significa que podrían crear herramientas de IA más poderosas con los mismos recursos que usan actualmente o consumir menos recursos para desarrollar modelos más nuevos.
Cómo funciona JEST
JEST funciona seleccionando lotes complementarios de datos para maximizar la capacidad de aprendizaje del modelo de IA. A diferencia de los métodos tradicionales que seleccionan ejemplos individuales, este algoritmo considera la composición de todo el conjunto. Por ejemplo, imagina que estás aprendiendo varios idiomas. En lugar de aprender inglés, alemán y noruego por separado, tal vez en orden de dificultad, podrías encontrar más efectivo estudiarlos juntos de una manera en la que el conocimiento de uno apoye el aprendizaje del otro. Google adoptó un enfoque similar y resultó exitoso. «Demostramos que la selección conjunta de lotes de datos es más efectiva para el aprendizaje que la selección de ejemplos de forma independiente», afirmaron los investigadores en su artículo. Para ello, los investigadores de Google utilizaron «aprendizaje contrastivo multimodal», donde el proceso JEST identificó dependencias entre puntos de datos. Este método mejora la velocidad y la eficiencia del entrenamiento de la IA al tiempo que requiere mucho menos poder de cómputo. La clave del enfoque fue comenzar con modelos de referencia previamente entrenados para dirigir el proceso de selección de datos, señaló Google. Esta técnica permitió que el modelo se centrara en conjuntos de datos de alta calidad y bien seleccionados, optimizando aún más la eficiencia del entrenamiento. «La calidad de un lote también es una función de su composición, además de la calidad sumada de sus puntos de datos considerados de forma independiente», explicó el artículo. Los experimentos del estudio mostraron sólidas ganancias de rendimiento en varios puntos de referencia. Por ejemplo, el entrenamiento en el conjunto de datos común WebLI utilizando JEST mostró mejoras notables en la velocidad de aprendizaje y la eficiencia de los recursos. Los investigadores también descubrieron que el algoritmo descubrió rápidamente sublotes altamente aprendibles, acelerando el proceso de entrenamiento al centrarse en piezas específicas de datos que «coinciden» entre sí. Esta técnica, conocida como «bootstrapping de calidad de datos», valora la calidad sobre la cantidad y ha demostrado ser mejor para el entrenamiento de IA. «Un modelo de referencia entrenado en un pequeño conjunto de datos seleccionados puede guiar eficazmente la selección de un conjunto de datos mucho más grande, lo que permite el entrenamiento de un modelo que supera ampliamente la calidad del modelo de referencia en muchas tareas posteriores», dijo el artículo. Editado por Ryan Ozawa.
Boletín informativo generalmente inteligente
Un viaje de IA semanal narrado por Gen, un modelo de IA generativa.
















