Alibaba ha rilasciato ufficialmente i pesi del modello per Qwen3.8-Flash-Next, offrendo agli sviluppatori un’anteprima e uno strumento di valutazione per la prossima architettura Qwen4. Progettato per gestire flussi di lavoro computazionali e generativi complessi, questo modello multimodale arriva insieme a configurazioni di test hardware di fascia alta, utilizzando in particolare l’infrastruttura NVIDIA GB300 NVL72 specificamente ottimizzata per attività avanzate di agentic coding.
Svolte Architetturali e Design Mixture-of-Experts
Il modello in anteprima appena svelato sfrutta una sofisticata architettura multimodale mixture-of-experts (MoE) progettata per bilanciare le prestazioni pure con l’efficienza di esecuzione. Separando la scala totale dei parametri dal calcolo attivo per token, il modello gestisce cicli di ragionamento impegnativi senza imporre penalità di latenza proibitive.
- Scala del Modello Principale: 125 miliardi di parametri che costituiscono il nucleo fondamentale.
- Embedding N-gram: Ulteriori 51 miliardi di parametri dedicati all’efficienza strutturale.
- Parametri Attivi: Solo 6 miliardi di parametri vengono attivati per token durante l’inferenza.
- Context Window Nativa: Una massiccia capacità di contesto nativa di 262.144 token.
- Contesto Esteso: Scalabile fino a 1.000.000 di token per l’analisi di repository di grandi dimensioni.
Potenziare l’Agentic Coding su NVIDIA GB300 NVL72
Mentre l’automazione dell’ingegneria software si sposta verso flussi di lavoro basati su agenti autonomi, i modelli linguistici di grandi dimensioni devono elaborare intere basi di codice, librerie di documentazione e cicli di feedback di esecuzione simultaneamente. La combinazione di Qwen3.8-Flash-Next e della piattaforma all’avanguardia GB300 NVL72 di NVIDIA fornisce la memoria ad alta larghezza di banda e la potenza di elaborazione parallela necessarie per sostenere queste azioni multi-step degli agenti in modo fluido.
Gli sviluppatori e i ricercatori che desiderano esplorare le capacità dell’anteprima dell’architettura Qwen4 possono accedere ai pesi del modello per effettuare benchmark sulla generazione di codice, sulla correzione degli errori e sulla navigazione software autonoma sotto carichi di lavoro pesanti.
Fonte: Articolo originale





