In Breve
- Che cosa descrive il tutorial NVIDIA?
- Un workflow per valutare, addestrare e rivalutare Nemotron 3 Nano con reinforcement learning ospitato e un adattatore LoRA.
- Quali risultati riporta NVIDIA?
- Su 32 problemi matematici, l’accuratezza indicata passa dal 21,9% al 90,6% dopo 100 step di training, con una spesa complessiva inferiore a 5 dollari.
- Il metodo può essere applicato ad altri modelli Nemotron?
- Sì. NVIDIA indica la possibilità di usare lo stesso workflow con Nemotron 3 Super e Nemotron 3 Ultra, verificandone prima la disponibilità nel catalogo live.
NVIDIA ha pubblicato un tutorial per personalizzare Nemotron 3 Nano attraverso Prime Intellect Lab, una piattaforma di training ospitato. Il flusso descritto consente di valutare il modello, addestrare un adattatore LoRA con reinforcement learning e verificare nuovamente le prestazioni senza gestire localmente un cluster di GPU.
Secondo i risultati riportati da NVIDIA, su 32 problemi matematici mantenuti fuori dal training l’accuratezza di Nemotron 3 Nano è passata dal 21,9% al 90,6% dopo 100 passaggi di addestramento. La spesa complessiva indicata per l’esperimento è stata inferiore a 5 dollari. Si tratta di dati presentati dall’azienda nel contesto del tutorial e non di una verifica indipendente.
Il flusso in tre fasi
Il tutorial utilizza l’ambiente Prime Intellect Math Python, nel quale il modello può ricorrere a Python, NumPy, SymPy e SciPy per risolvere problemi matematici. Per l’esperimento, ogni esecuzione è stata limitata a un massimo di cinque turni dell’assistente.
- Valutazione iniziale: viene eseguito un test su 32 esempi per stabilire il comportamento di base del modello.
- Addestramento: viene avviato un training di 100 step con reinforcement learning con ricompense verificabili e un adattatore LoRA. La configurazione prevede otto tentativi per attività, batch da 32 esempi e learning rate pari a 2e-5.
- Nuova valutazione: l’adattatore viene reso disponibile tramite un endpoint di inferenza e il modello viene testato sugli stessi parametri usati nella valutazione iniziale.
NVIDIA riferisce che il punteggio medio della ricompensa è salito da 0,219 a 0,906. Sui 32 problemi, le risposte corrette sono aumentate da 7 a 29: 23 dei 24 casi con esito modificato sono migliorati, mentre uno è peggiorato.
Un ambiente gestito, con catalogo e prezzi variabili
La configurazione illustrata richiede un ambiente Python supportato, curl, un account Prime Intellect con accesso all’Hosted Training e la fatturazione attiva. La piattaforma gestisce rollout, training e infrastruttura di inferenza, mentre l’utente interagisce con la CLI Prime Intellect.
Il tutorial specifica che disponibilità dei modelli e prezzi possono cambiare nel tempo. Per questo NVIDIA raccomanda di consultare il catalogo live della CLI prima di avviare l’addestramento, invece di basarsi su identificativi o prezzi riportati in un articolo statico.
Lo stesso approccio per Super e Ultra
Secondo NVIDIA, il workflow può essere riutilizzato anche con Nemotron 3 Super e Nemotron 3 Ultra modificando l’identificativo del modello nella configurazione. Per Super viene indicato il modello nvidia/NVIDIA-Nemotron-3-Super-120B-A12B-BF16, mentre per Ultra il tutorial riporta nvidia/NVIDIA-Nemotron-3-Ultra-550B-A55B-NVFP4.
Anche per i modelli più grandi l’azienda raccomanda di verificare prima la disponibilità nel catalogo, stabilire una baseline, controllare la varietà delle ricompense, addestrare e ripetere il test mantenendo invariati i parametri di confronto.
Il ruolo dell’adattatore LoRA
Al termine del training, Prime Intellect Lab carica l’adattatore LoRA come artefatto scaricabile. L’adattatore può essere distribuito per l’inferenza tramite la piattaforma; lo stato passa da NOT_DEPLOYED a DEPLOYING e quindi a DEPLOYED. NVIDIA segnala che la creazione dell’endpoint di inferenza comporta un costo.
Il tutorial presenta il risultato come un esempio di ciclo di personalizzazione osservabile e ripetibile: misurazione iniziale, ottimizzazione e nuova valutazione. L’esperimento resta circoscritto all’ambiente matematico utilizzato e ai parametri descritti da NVIDIA.

