Qwen、Qwen4向け新設計を先行公開 「Qwen3.8-Flash-Next」のモデル配布開始

Qwen、Qwen4向け新設計を先行公開 「Qwen3.8-Flash-Next」のモデル配布開始

※記事を視覚化したイメージであり、実際の事象とは異なります。

本サイトの記事や画像は、AIが公的資料や複数の報道を基に事実関係を整理・再構成し制作したものです。[続きを表示]特定の報道内容や表現を再利用・要約することを目的としたものではありません。ただし、誤りや不確定な情報が含まれる可能性がありますので、参考の一助としてご覧いただき、実際の判断は公的資料や各出典元の原文をご確認ください。[私たちの取り組み]

アリババ・グループのQwenチームは2026年8月26日付の公式ブログで、次世代Qwen4で採用予定の設計を先行搭載したAIモデル「Qwen3.8-Flash-Next」を発表した。正式なQwen4モデル群ではなく、そのアーキテクチャを先行評価できるマルチモーダルMoEモデルである。

Qwen4向けの注意機構を先行搭載

Qwen3.8-Flash-Nextは、従来のGated DeltaNet(GDN)とGated Attentionの組み合わせを、GDNとQwen Sparse Attention(QSA)のハイブリッド注意機構へ更新した。Gated Residual、N-gram Embedding、Muon最適化も新設計の柱となる。

主モデルは125Bパラメータで、51BのN-gram Embeddingと4BのMTPを備える。各トークンで活性化するパラメータは6B。ネイティブのコンテキスト長は262,144トークンで、YaRNにより100万トークンまで拡張できる。

モデルデータと実行手順を公開

モデルデータはHugging FaceとModelScopeで配布されている。Hugging FaceではTransformers、vLLM、SGLangなどの実行方法が案内されている。8月28日時点では、Qwen3.8-Flash-Nextを基にした本番版「Qwen3.8-Flash」がQwenCloudで提供され、QwenWorkの「Standard」モードにも統合されている。

Hugging Faceで表示される元チェックポイントの容量は360GB。モデルデータをダウンロードできることと、360GBの元データを一般的なPCでそのまま実行できることは別である。一方、量子化版やllama.cpp、MLXなどを使うローカル利用の選択肢も案内されている。

学習コストは約9分の1と自社評価

Qwenによると、Qwen3.8-Flash-NextはQwen3.7-Plusと比べて学習コストを約9分の1に抑えながら、コーディングやオフィス作業の能力を高めた。これはQwenによる自己評価である。

Qwenは今回の設計をさらに改良し、正式なQwen4モデル群へつなげる方針だ。

参考・出典

本サイトの記事や画像は、AIが公的資料や複数の報道を基に事実関係を整理・再構成し制作したものです。特定の報道内容や表現を再利用・要約することを目的としたものではありません。ただし、誤りや不確定な情報が含まれる可能性がありますので、参考の一助としてご覧いただき、実際の判断は公的資料や各出典元の原文をご確認ください。[私たちの取り組み]

ニュースはAIで深化する—。日々の出来事を深掘りし、次の時代を考える視点をお届けします。

本サイトの記事や画像はAIが公的資料や報道を整理し制作したものです。
ただし誤りや不確定な情報が含まれることがありますので、参考の一助としてご覧いただき、
実際の判断は公的資料や他の報道を直接ご確認ください。
[私たちの取り組み]