注目★★★★★Hugging Face Papers
RNG-Bench: 非マルコフゲームでMLLMの記憶再構成能力を評価
30秒で把握
- 1RNG-Bench公開・非マルコフゲームでMLLMの記憶再構成能力を単独評価
- 2最大128Kトークン・350画像/エピソード・フロンティアMLLMは未飽和
- 3Memory Gap指標で誤りの主因が忘却と判明・Qwen3.5-9Bで転移改善を確認
要約
研究チームはマルチモーダル大規模言語モデル(MLLM)の「過去観測の再構成能力」を単独で評価するベンチマーク「RNG-Bench」を公開した。RNG-Benchはカードのマッチングと3D迷路の2ゲームで構成され、最大128Kトークン・350画像/エピソードという高負荷設定で現行フロンティアMLLMはいずれも飽和に程遠い。独自指標「Memory Gap」の分析により、残存エラーの大半は意思決定の誤りではなく過去観測の忘却に起因することが判明した。
あなたへの影響
エージェント・ロボット・ゲームAIなどMLLMを閉ループ制御に組み込む場合、過去観測の忘却が主要なボトルネックになり得るため、長期コンテキストや外部メモリ機構の設計を検討するチームは本ベンチマークを評価基準として参照する価値がある。
推奨:現時点で即時対応は不要です。必要に応じて原文を確認してください。