Alibaba, yaklaşan Qwen4 mimarisi için geliştiricilere erken bir önizleme ve değerlendirme aracı sunan Qwen3.8-Flash-Next model ağırlıklarını resmi olarak yayınladı. Karmaşık hesaplama ve üretken iş akışlarını ele almak üzere tasarlanan bu çok modlu model, özellikle gelişmiş ajan tabanlı kodlama görevleri için uyarlanmış olan NVIDIA GB300 NVL72 altyapısından yararlanan üst düzey donanım test konfigürasyonlarıyla birlikte geliyor.
Mimari Atılımlar ve Uzmanlar Karışımı Tasarımı
Yeni tanıtılan önizleme modeli, ham performansı yürütme verimliliğiyle dengelemek için tasarlanmış gelişmiş bir çok modlu uzmanlar karışımı (MoE) mimarisinden yararlanır. Toplam parametre ölçeğini aktif token başına hesaplamadan ayıran model, yasaklayıcı gecikme cezaları getirmeden zorlu akıl yürütme döngülerini yönetir.
- Ana Model Ölçeği: Temel çekirdeği oluşturan 125 milyar parametre.
- N-gram Gömmeleri: Yapısal verimliliğe adanmış ek 51 milyar parametre.
- Aktif Parametreler: Çıkarım sırasında token başına yalnızca 6 milyar parametre etkinleştirilir.
- Yerel Bağlam Penceresi: Devasa bir 262.144 token yerel bağlam kapasitesi.
- Genişletilmiş Bağlam: Uzun biçimli depo analizi için 1.000.000 tokene kadar ölçeklenebilir.
NVIDIA GB300 NVL72 Üzerinde Ajan Tabanlı Kodlamaya Güç Vermek
Yazılım mühendisliği otomasyonu otonom ajan iş akışlarına doğru kayarken, büyük dil modelleri tüm kod tabanlarını, dokümantasyon kütüphanelerini ve çalışma zamanı geri bildirim döngülerini aynı anda işlemelidir. Qwen3.8-Flash-Next ile NVIDIA’nın son teknoloji GB300 NVL72 platformunun birleşimi, bu çok adımlı ajan eylemlerini kesintisiz olarak sürdürmek için gereken yüksek bant genişlikli belleği ve paralel işleme gücünü sağlar.
Qwen4 mimarisi önizlemesinin yeteneklerini keşfetmek isteyen geliştiriciler ve araştırmacılar, ağır iş yükleri altında kod üretimi, hata düzeltme ve otonom yazılım navigasyonunu kıyaslamak için model ağırlıklarına erişebilir.
Kaynak: Orijinal Makale





