注目★★★★★Hugging Face Papers
テンセント、コーディングエージェント評価ベンチマーク WorkBuddy Bench を公開
30秒で把握
- 1テンセント、WorkBuddy Bench を公開・コード/Web/Office/セキュリティ 4 領域で 500+ タスク収録
- 2実際のコミットやプルリクエストから逆算・Web 検索による汚染耐性を実装的に確保
- 3完全公開で再現性を確保・CodeBuddy Code と Claude Code で統一プロトコル下評価
要約
テンセントはコーディングエージェント向けの統合評価スイート「WorkBuddy Bench」を公開した。コード、Web、Office、セキュリティの 4 領域で、実際のコミットやプルリクエスト、ビジネスシナリオから逆算して構築した 500+ タスクを含む。公開データセット (タスク、環境イメージ、評価ツール、参照実装) とバージョニング戦略により、Web 検索による汚染に耐性を持つ設計となっている。
あなたへの影響
コーディングエージェント評価がより厳密になるため、自社の LLM エージェント検証や外部モデル選定時に参考値としての信頼性が上がる。
推奨:ベンチマーク汚染への実装的アプローチ (公開 + バージョニング) は、他の評価フレームワーク設計にも応用できる。