Publi

Nvidia Lanza Nemotron 3 Super: Un Modelo de IA de 120 Miles de Millones de Parámetros

Características del Modelo

Nvidia ha presentado el Nemotron 3 Super, un modelo de IA con 120 mil millones de parámetros, diseñado específicamente para agentes autónomos y tareas de contexto ultralargo.

Arquitectura Avanzada

  • Diseño Híbrido Mamba-Transformer MoE: Ofrece una mayor velocidad de razonamiento y más de 5 veces el rendimiento al operar a 4 bits de precisión.
  • Parámetros Activos: Activa 12 mil millones de parámetros de los 120 mil millones totales, optimizando costos de inferencia.
  • Ventana de Contexto: Capaz de manejar hasta 1 millón de tokens, permitiendo a los agentes almacenar grandes volúmenes de información antes de que se descompongan.

Innovaciones Técnicas

El modelo combina componentes poco comunes en la misma arquitectura:

Publicidad
  • Capas de Estado Mamba-2: Proporcionan una alternativa rápida y eficiente en memoria para manejar flujos de tokens largos.
  • Capas de Atención Transformer: Garantizan una recuperación precisa de información.
  • Nuevo Diseño «Latent MoE»: Comprime las incrustaciones de tokens antes de enviarlas a expertos, permitiendo activar cuatro veces más especialistas al mismo costo computacional.

Entrenamiento y Precisión

El modelo fue preentrenado nativamente en el formato NVFP4 de Nvidia, lo que le permite operar de manera efectiva en aritmética de 4 bits desde la primera actualización de gradiente. Esto marca una diferencia significativa al evitar la pérdida de precisión común en modelos comprimidos después de ser entrenados.

Comparativa de Rendimiento

Nemotron 3 Super supera a su predecesor, ofreciendo más de cinco veces el rendimiento de inferencia. En comparación con competidores externos, es:

  • 2.2 veces más rápido que el GPT-OSS 120B de OpenAI.
  • 7.5 veces más rápido que el Qwen3.5-122B de Alibaba.

Integración en el Mercado

El modelo se encuentra en proceso de integración en flujos de trabajo de empresas como Perplexity, Palantir, Cadence y Siemens. La cartera completa de entrenamiento, incluidos los pesos en Hugging Face, es pública, con más de 10 billones de tokens curados utilizados durante el preentrenamiento.

Inversión Estratégica de $26 Mil Millones

Nvidia planea invertir $26 mil millones en los próximos cinco años para desarrollar modelos de IA de peso abierto, en respuesta a la creciente competencia de China en este campo. La adopción de modelos abiertos por parte de empresas chinas ha aumentado considerablemente, representando aproximadamente el 30% del uso global.

Desafíos en el Mercado

Mientras que gigantes como OpenAI y Google mantienen modelos cerrados, empresas chinas están inundando el ecosistema de modelos abiertos. Este cambio significa que el fosso entre el «mejor modelo propietario» y el «mejor modelo abierto» se ha reducido drásticamente.

Riesgos Fundamentales

Una nueva amenaza se cierne sobre el hardware, con rumores sobre un modelo DeepSeek que podría haberse entrenado exclusivamente en chips de Huawei, lo que fomentaría una dependencia global en la infraestructura china.

Conclusión

Nvidia se enfrenta a un momento crucial, donde la competencia en el ámbito de la IA abierta y la infraestructura subyacente determinarán su futuro en el mercado.

Suscribirse al Boletín Diario

Mantente al día con las principales noticias y características originales. ¡Regístrate para recibir nuestro boletín diario!

Descargo de responsabilidad: Los puntos de vista y opiniones expresadas en este artículo pertenecen a su autor y no necesariamente reflejan aquellas de CriptoPasion. La opinión del autor es a título informativo y en ninguna circunstancia constituye una recomendación de inversión ni asesoría financiera.