注目★★★★★Hugging Face Papers
Gander公開、映像・音声・テキストで全二重エージェント対話
30秒で把握
- 1Ganderが映像・音声・テキストの全二重対話と推論を統合
- 2CerebellumとBrainをtool callingで連携し複雑な処理に対応
- 3雑音・複数人対話に対応しモデル・コード・データを公開
要約
Ganderは、映像・音声・テキストを連続入力し、リアルタイムの全二重対話とエージェント推論を単一フレームワークに統合したエンドツーエンドモデルとして公開された。従来のターン制と異なり、ユーザーはいつでも割り込みでき、モデルは途中経過のフィードバックや追加質問を自発的に返す。リアルタイム対話を担うCerebellumと、複雑な推論・エージェント処理を担うBrainを、tool callingとエージェント実行基盤で連携させる。Cerebellumには、入出力をチャンク単位の順序付きtoken streamへ統合するstreaming Thinker-Talker構成を採用した。会話能力、全モーダル理解、対話能力、エージェント知能を評価し、雑音、複数人対話、相づちを含む現実的な環境で堅牢性を確認した。モデル、コード、データを公開した。
あなたへの影響
音声・映像を扱うエージェント開発者は、ターン制APIだけでなく割り込み可能な全二重対話と、Cerebellum-Brain分離の実装を次の評価対象に加えるべきです。
推奨:chunk-level token streamは、入力と出力を低遅延で連続処理する設計です。