注目★★★★★Hugging Face Papers
AIベンチマークを横断検索、Benchmark Radarが1,283件を収録
30秒で把握
- 1Benchmark RadarがAIベンチマークを横断検索する継続更新DBを公開
- 237ソースを毎日収集し1,283件の記録と12,916件の数値観測を収録
- 3Web画面とCLIでスコア履歴・評価根拠・利用動向を確認可能
要約
Benchmark Radarは、AIベンチマークの論文、データセット、コード、スコア履歴を横断検索できる継続更新型のデータベースを公開した。LLM、エージェント、コーディング、推論、安全性などの評価を対象に、毎日37の公開ソースから情報を収集する。カタログには1,283件のソース記録と、790件に対する12,916件の数値観測を収録した。Webダッシュボードでは、リーダーボード、スコアと利用実績のPareto frontier、飽和度・トレンド表示、証拠のダウンロードを利用でき、オフライン検索用CLIと再現可能な分析も提供する。出典と引用を保持し、ベンチマーク選定時に評価条件と根拠を確認できる。
あなたへの影響
AI評価を設計する日本の研究者・開発者は、Benchmark Radarで既存ベンチマークの採用状況と評価条件を確認し、重複した評価の追加を避ける材料にできる。
推奨:スコア比較には条件差や飽和の限界があるため、数値だけでなく収録された出典と証拠も確認する運用が必要になる可能性がある。