A Alibaba lançou oficialmente os pesos do modelo Qwen3.8-Flash-Next, oferecendo aos desenvolvedores uma prévia inicial e um veículo de avaliação para a próxima arquitetura Qwen4. Projetado para lidar com fluxos de trabalho computacionais e generativos complexos, este modelo multimodal chega acompanhado de configurações de teste de hardware de ponta, utilizando especialmente a infraestrutura NVIDIA GB300 NVL72, adaptada especificamente para tarefas avançadas de programação autônoma (agentic coding).
Avanços arquiteturais e design de Mistura de Especialistas
O modelo de prévia recém-revelado utiliza uma arquitetura sofisticada de mistura de especialistas multimodal (MoE), projetada para equilibrar o desempenho bruto com a eficiência de execução. Ao separar a escala total de parâmetros do cálculo ativo por token, o modelo gerencia loops de raciocínio exigentes sem impor penalidades proibitivas de latência.
- Escala Principal do Modelo: 125 bilhões de parâmetros formando o núcleo fundamental.
- Incorporações N-gram: 51 bilhões de parâmetros adicionais dedicados à eficiência estrutural.
- Parâmetros Ativos: Apenas 6 bilhões de parâmetros são ativados por token durante a inferência.
- Janela de Contexto Nativa: Uma capacidade maciça de contexto nativo de 262.144 tokens.
- Contexto Estendido: Escalável até 1.000.000 de tokens para análise de repositórios de longo formato.
Potencializando a programação autônoma na NVIDIA GB300 NVL72
À medida que a automação da engenharia de software migra para fluxos de trabalho de agentes autônomos, grandes modelos de linguagem precisam processar bases de código inteiras, bibliotecas de documentação e loops de feedback de tempo de execução simultaneamente. A combinação do Qwen3.8-Flash-Next com a plataforma de ponta GB300 NVL72 da NVIDIA fornece a memória de alta largura de banda e o poder de processamento paralelo necessários para sustentar essas ações de agentes em várias etapas sem interrupções.
Desenvolvedores e pesquisadores que desejam explorar os recursos da prévia da arquitetura Qwen4 podem acessar os pesos do modelo para avaliar a geração de código, a correção de erros e a navegação autônoma de software sob cargas de trabalho pesadas.
Fonte: Artigo original





