Asayomu Tech
注目★★★★★Hugging Face Papers

RNG-Bench: 非マルコフゲームでMLLMの記憶再構成能力を評価

30秒で把握

  • 1RNG-Bench公開・非マルコフゲームでMLLMの記憶再構成能力を単独評価
  • 2最大128Kトークン・350画像/エピソード・フロンティアMLLMは未飽和
  • 3Memory Gap指標で誤りの主因が忘却と判明・Qwen3.5-9Bで転移改善を確認

要約

研究チームはマルチモーダル大規模言語モデル(MLLM)の「過去観測の再構成能力」を単独で評価するベンチマーク「RNG-Bench」を公開した。RNG-Benchはカードのマッチングと3D迷路の2ゲームで構成され、最大128Kトークン・350画像/エピソードという高負荷設定で現行フロンティアMLLMはいずれも飽和に程遠い。独自指標「Memory Gap」の分析により、残存エラーの大半は意思決定の誤りではなく過去観測の忘却に起因することが判明した。

あなたへの影響

エージェント・ロボット・ゲームAIなどMLLMを閉ループ制御に組み込む場合、過去観測の忘却が主要なボトルネックになり得るため、長期コンテキストや外部メモリ機構の設計を検討するチームは本ベンチマークを評価基準として参照する価値がある。

推奨:現時点で即時対応は不要です。必要に応じて原文を確認してください。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。