注目★★★★★Hugging Face Papers
機械翻訳の限界を測るLTBv1、3456例で最新モデルを破る
30秒で把握
- 1LTBv1が最新翻訳モデルを破る3456件の難訳例を収録
- 2テキスト・画像・音声・動画と人手作成の検証ルールを採用
- 3自動指標の飽和を補い再現可能な失敗分析を実現
要約
Last Translation Benchmarkは、最新の機械翻訳モデルが失敗する3456件の難訳例を収録した評価データセットを公開した。例にはテキスト、画像、音声、動画が含まれ、すべて人手で作成・査読されている。各例には具体的な失敗条件を記した検証ルールが付き、自動評価指標や再現性に乏しい人手評価より、再現可能で改善に直結する評価を可能にする。最新版LTBv1は2026年9月1日までに採択された投稿を収録し、継続的な追加を受け付ける。
あなたへの影響
機械翻訳を評価する日本の開発・研究チームは、既存ベンチマークだけで性能を判断せず、LTBv1の難訳例と検証ルールを次回評価計画で確認するとよい。
推奨:多言語・文化的推論の失敗を具体的に検証する用途に向く。