注目★★★★★Hugging Face Papers
ARC-AGI ベンチマーク、推論を内部化した 150M パラメータモデルで新効率達成
30秒で把握
- 1BDH-CQ が ARC-AGI-1 で 29.5% pass@2・推論コスト $0.0007/タスク・150M パラメータで新効率達成
- 2潜在空間の反復計算で推論を内部化・入力が再帰メモリを継続更新・中間ステップを言語化しない設計
- 3コスト・精度フロンティア突破・小規模モデルと推論効率の両立が可能であることを実証
要約
BDH-CQ は文脈内学習と繰り返しの潜在推論を組み合わせた推論モデルで、推論時の入力がモデルの再帰的メモリを継続的に更新し、高次元潜在空間での反復計算で推論を進め、中間ステップを言語化しない。150M パラメータ構成が ARC-AGI-1 ベンチマーク上で pass@2 29.5% を達成し、推論コストは 1 タスク当たり $0.0007 で、これまで報告されていたコスト・精度フロンティアを突破した。この成果は ARC-AGI-1 の新たな最先端効率を確立する。
あなたへの影響
ARC-AGI のような複雑な推論ベンチマークで、パラメータ数と推論コストを抑えながら精度を達成する設計の実例は、実運用環境での言語モデルの活用選択肢を広げる。
推奨:推論の内部化 (言語化しない中間ステップ) が現在のシステムプロンプトやチェーン・オブ・ソートの方針の代替可能性を示唆し、エッジ推論や低リソース環境での展開を検討するチームは当該手法の評価価値がある。