注目★★★★★Hugging Face Papers
Jet-Long:動的RoPEで長文対応を高速化、文脈拡張の推論コスト 4% 削減
30秒で把握
- 1Jet-Long がゼロショット長文拡張で RoPE スケーリング係数を動的に適用・短文精度保持と長文外挿を両立
- 2Qwen3 1.7B/4B/8B で 128K トークン対応時 RULER 比 +2〜4.79pp 向上・推論オーバーヘッド 4% 以下
- 3H100 上でプリフィル処理 1.39 倍高速化・CuTe カーネル融合で長文 RAG とエージェントワークフローに最適
要約
Jet-Long は短文と長文で異なる RoPE スケーリング係数を動的に適用するゼロショット長文拡張手法を提案した。短入力では元モデル性能を保ちながら長文入力では外挿精度を維持し、推論時に本質的なオーバーヘッドがない。Qwen3 1.7B/4B/8B で 128K トークン対応時、既存最強手法 RULER 比で +2〜4.79pp の精度向上を達成し、単一バッチ生成で全長さにおいて 4% 以下のオーバーヘッドに抑えた。
あなたへの影響
128K トークン以上のコンテキストを扱う RAG やマルチターン推論システムの構築時に、推論コストと精度のバランスを改善する選択肢が増えた。
推奨:既存モデルの追加学習なしで導入できるため、現行デプロイメントの長文対応化を検討するチームは Jet-Long の性能を手元のベンチマークで評価する価値がある。