ニュース

究極のコスト構造を目指したAIモデル「Qwen3.8-Flash-Next」

 Alibaba Cloudは、今後リリースが予定される「Qwen4」で使用されるアーキテクチャの早期プレビューとしても機能するマルチモーダルMoEモデル「Qwen3.8-Flash-Next」を発表した。Qwen3.8-Flash-Nextは、Hugging FaceとModelScopeで利用可能。デフォルトで100万のコンテキストと公式の組み込みツールを備えた製品版は、QwenCloud上でQwen3.8-Flashとして提供されており、価格は入力トークン100万個あたり0.16ドル、出力トークン100万個あたり0.47ドル。

 Qwen3.8-Flash-Nextは、モデルを体系的にアップグレードし、モデルの能力を向上させると同時に、計算効率、モデル容量、トレーニングの安定性を最適化している。長文コンテキストでの高い検索性能と計算効率を両立したアーキテクチャ「Gated DeltaNet(GDN)」を採用しており、履歴を効率的に圧縮。Qwen Sparse Attention(QSA)は圧縮された推論に必要な関連情報を使用し、マイクロブロック単位で重要なコンテキストを選択することで、長いシーケンスに対するコストを大幅に削減する。

 ゲート付き残差は、深層学習モデルにおけるレイヤの情報の通り道を4つに拡張し、動的ゲートで読み書きを制御することで、レイヤ間情報フローとトレーニングの安定性が強化されている。

 テキストをトークンの並びとして切り出し、その表層的な並びパターンを分散表現や記憶テーブルとして保持・参照するNグラム埋め込みは、ローカルコンテキストを使用しテーブルを検索。わずかな追加計算でモデルの容量を拡張する。

Qwen3.8-Flash-Nextのアーキテクチャ

 Qwen3.8-Flash-Nextは、125Bパラメータのメインモデルに加え、51BのNグラム埋め込みを備え、トークンごとに6Bのパラメータが有効化されている。Qwen3.8-Flash-Nextは、Qwen3.7-Plusと比較するとトレーニングと推論の両方のコストが大幅に削減されている。トレーニングにかかる時間はわずか約9分の1となっている。Qwen3.8-Flash-Nextは、AIが1度に記憶・処理できるトークンの最大量をネイティブで262,144個サポートしており、YaRNを使用することで1,000,000個のトークンまで拡張可能。

100万トークンの場合、プリフィルとデコードでそれぞれ最大7.6倍と4.9倍の高速化を実現。キャッシュ再利用率が高いオンラインサービスシナリオの実験設定では、100万トークンのコンテキスト長でQwen3.7-Plusの8.6倍のプリフィルスループットを実現している