Research
学習不要のスパースAttention「RBS-Attention」、128Kトークン処理を最大20倍高速化
2026/09/22
長文処理のボトルネック「プリフィル」に新たなアプローチ
大規模言語モデル(LLM)における推論処理は、トークン生成が始まる前にプロンプト全体を密なSelf-Attentionで処理する「プリフィル」フェーズが性能上の制約となっている。コンテキスト長が128Kトークンに達するような長文処理では、この計算コストが特に顕著になる。
米国時間2025年、arXivに投稿された論文「RBS-Attention: Radius-Bounded Sparse Prefill for Long-Context Large Language Models」では、この課題に対して学習(ファインチューニング)を一切必要としないスパースプリフィル手法が提案されている。
「平均希釈」問題とデュアルブランチ選択
既存のスパースブロック選択手法では、ブロックの重心(セントロイド)を用いて関連性の高いブロックを選択する。しかし、この手法には根本的な問題があると論文は指摘する。ブロック内に無関係なトークンが多数混在すると、重心が希釈されてしまい、実は重要なトークンを含むブロックが選択から漏れるケースが生じる。研究チームはこの失敗モードを「平均希釈(Mean Dilution)」と呼んでいる。
これを解決するために提案されたのが、2つの相補的な選択ブランチを持つ「RBS-Attention」だ。
- セントロイドベースブランチ(Centroid Base Branch):従来どおりブロックの平均的な関連性を捉える
- レスキューブランチ(Rescue Branch):各ブロックの最大キー半径(radius)と、プロンプト・レイヤー・ヘッドごとの分布を活用し、過小評価されるリスクのあるブロックを特定して救済する
2つのブランチのマスクを独立してしきい値処理したうえで統合することで、レスキューブロックの寄与度を制御しながら、通常のブロックスパースFlashAttentionの実行フローを維持できると説明されている。
H100 GPUでの実測パフォーマンス
論文によると、NVIDIA H100 GPU上での評価では、Qwen3-30B-A3B-Instruct-2507-FP8モデルを用いた128Kトークンのコンテキスト処理において以下の高速化が報告されている。
| 指標 | 高速化倍率 |
|---|---|
| スタンドアロンのプリフィルAttention | 20.65倍 |
| vLLMのプリフィルAttention | 11.92倍 |
| エンドツーエンドのTime-To-First-Token(TTFT) | 5.97倍 |
精度への影響は最小限と報告
スパース化による精度低下も検証されており、密なアテンションを用いた場合と比較した結果が示されている。密なQwen3-32BモデルによるRULERベンチマークの総合精度は、RBS-Attentionが88.65であるのに対し、通常の密なAttentionは89.52であったと報告されている。差は約0.87ポイントにとどまっており、大幅な速度向上に対して精度の損失は限定的であるとされている。
さらに、LongBench-v2、InfiniteBench、Video-MMEといった複数のベンチマークでも品質評価が実施されている。また、補足実験として、実際のブロック保持率の計測、同一スパース密度での各セレクタの比較、ブロックサイズ・しきい値・メモリ挙動の特性評価も行われているという。
実用的な意義
RBS-Attentionの最大の強みは、追加学習なしに導入可能な点だ。既存のモデルにそのまま適用でき、vLLMなどの推論フレームワークとの統合も視野に入れた評価がなされている。長文RAGや長大なドキュメント処理、動画理解といったユースケースにおいて、推論コストの削減に貢献する技術として注目される。
論文はarXiv(arXiv:2609.20971)にて公開されている。
出典: RBS-Attention: Radius-Bounded Sparse Prefill for Long-Context Large Language Models