Nvidia posiciona Vera Rubin para el posentrenamiento continuo de agentes de IA
La noticia en cinco frases
- Nvidia presenta el posentrenamiento continuo como una carga informática central de la IA agéntica.
- La empresa propone la inteligencia por dólar como métrica complementaria al coste por token.
- NeMo Gym y NeMo RL pretenden estandarizar los entornos de entrenamiento distribuido y el aprendizaje por refuerzo.
- Nvidia afirma que Vera Rubin puede entrenar los modelos más grandes con una cuarta parte de las GPU Blackwell.
- La mayoría de las cifras de rendimiento y eficiencia proceden de Nvidia o de las empresas asociadas mencionadas.
Explicación completa
Nvidia presenta el posentrenamiento continuo como un ciclo recurrente para agentes de IA. Herramientas y entornos simulados o relacionados con producción generan ejecuciones, los intentos se evalúan y los resultados se emplean para actualizar nuevamente los pesos. NeMo Gym aporta los entornos, mientras NeMo RL coordina el aprendizaje por refuerzo distribuido. La mejora repetida pretende convertirse en una carga estándar.
Junto al coste por token, Nvidia promueve la inteligencia por dólar para valorar la creación y la mejora continuada de un modelo. La empresa cita Nemotron 3 Ultra, un mixture-of-experts de 550.000 millones de parámetros, y comunica un 71,7 por ciento en SWE-bench. Es una cifra de Nvidia. También afirma que Vera Rubin puede entrenar los modelos más grandes con una cuarta parte de las GPU necesarias con Blackwell.
Otros datos proceden de socios. Prime Intellect comunica un 30 por ciento más de rendimiento de CPU y Perplexity una sincronización inferior a dos segundos para modelos con billones de parámetros. Siguen siendo afirmaciones de proveedores. Los planes de Together y Prime Intellect reflejan usos futuros, no producción establecida. La información respalda el posicionamiento, pero no una ventaja neutral demostrada.