注目★★★★★Hugging Face Papers
画像差分ベンチマークVDiff-Bench、MLLMの微細変化検出に弱点
30秒で把握
- 1VDiff-Benchが画像差分1,756問でMLLMの微細変化識別を評価
- 211モデルを10カテゴリで比較しノイズ・テクスチャの弱点を検出
- 37〜8Bモデルは低レベル変化で8.7〜33.3%に低下
要約
VDiff-Benchは、類似画像間の微細な差分を識別するMLLM向けベンチマークとして公開された。画像ペアを使う4択問題を1,756問収録し、位置、動き、色、テクスチャ、OCR、照明など10種類の変化を評価する。11モデルの実験では、7〜8B規模のオープンモデル3種が意味的変化で52.5〜70.6%を得た一方、ノイズやテクスチャなど低レベル変化では8.7〜33.3%に落ちた。モデルは画像間の差分を「違いなし」と誤判定しやすく、単一画像タスクでは見えない比較能力の弱点が判明した。Grok 4.3もノイズとテクスチャの識別で大きく性能を落とし、Kimi K2.5やK3を下回った。
あなたへの影響
画像差分を使う検査・検索・生成評価の開発者は、単一画像ベンチマークだけで判断せず、VDiff-Benchのような微細変化を含む評価を追加してください。
推奨:低レベル変化を「違いなし」とする誤判定が起こり得るため、実データでノイズやテクスチャの検出精度を個別に検証する必要があります。