0%
Zum Inhalt springen
27 August 2026
SpracheDeutsch
System

Darstellung

Technologie

Qwen3.8-Flash-Next auf NVIDIA GB300 NVL72 getestet

Entdecken Sie Alibabas Qwen3.8-Flash-Next für agentisches Programmieren, evaluiert auf NVIDIA GB300 NVL72-Hardware mit massivem Kontextfenster.

2 Min. Lesezeit
Qwen3.8-Flash-Next, NVIDIA GB300 NVL72, Qwen4 Architektur, Hardware, KI-Modelle, Technologie

Alibaba hat offiziell die Modellgewichte für Qwen3.8-Flash-Next veröffentlicht und bietet Entwicklern damit eine frühe Vorschau sowie Evaluierungsplattform für die kommende Qwen4-Architektur. Dieses multimodale Modell wurde entwickelt, um komplexe Rechen- und generative Arbeitsabläufe zu bewältigen. Es wird zusammen mit High-End-Hardware-Testkonfigurationen eingeführt, wobei insbesondere die NVIDIA GB300 NVL72-Infrastruktur genutzt wird, die speziell auf fortgeschrittene agentische Programmieraufgaben zugeschnitten ist.

Architektonische Durchbrüche und Mixture-of-Experts-Design

Das neu vorgestellte Vorschaumodell nutzt eine ausgeklügelte multimodale Mixture-of-Experts-Architektur (MoE), die darauf ausgelegt ist, rohe Leistung mit Ausführungseffizienz in Einklang zu bringen. Durch die Trennung der Gesamtzahl der Parameter von den aktiven Parametern pro Token bewältigt das Modell anspruchsvolle Argumentationsschleifen, ohne unzumutbare Latenzzeiten zu verursachen.

  • Hauptmodellskala: 125 Milliarden Parameter bilden den Kern.
  • N-Gramm-Einbettungen: Zusätzliche 51 Milliarden Parameter, die der strukturellen Effizienz dienen.
  • Aktive Parameter: Nur 6 Milliarden Parameter werden pro Token während der Inferenz aktiviert.
  • Natives Kontextfenster: Eine massive native Kontextkapazität von 262.144 Token.
  • Erweiterter Kontext: Skalierbar auf bis zu 1.000.000 Token für die Analyse umfangreicher Repositorys.

Agentisches Programmieren auf NVIDIA GB300 NVL72 antreiben

Da sich die Automatisierung in der Softwaretechnik hin zu autonomen agentischen Arbeitsabläufen verlagert, müssen große Sprachmodelle gesamte Codebasen, Dokumentationsbibliotheken und Laufzeit-Feedbackschleifen gleichzeitig verarbeiten. Die Kombination aus Qwen3.8-Flash-Next und NVIDias modernster GB300 NVL72-Plattform bietet den hochbandbreitigen Speicher und die Rechenleistung für die parallele Verarbeitung, die erforderlich sind, um diese mehrstufigen Agentenaktionen nahtlos zu unterstützen.

Entwickler und Forscher, die die Funktionen der Qwen4-Architekturvorschau erkunden möchten, können auf die Modellgewichte zugreifen, um die Code-Generierung, Fehlerkorrektur und autonome Software-Navigation unter hoher Last zu benchen.

Quelle: Originalartikel

Das Könnte Sie Auch Interessieren:  Schwachstellen in Lieferketten bedrohen Tech-Hardware
Portrait of Tayfur Keleş

Redaktionelle Verantwortung

Tayfur Keleş

Gründer & verantwortlicher Redakteur

Digital content creator and entrepreneur focused on global media platforms, multi-language publishing, and modern web technologies.