Asayomu Tech
注目★★★★Hugging Face Papers

Gander公開、映像・音声・テキストで全二重エージェント対話

30秒で把握

  • 1Ganderが映像・音声・テキストの全二重対話と推論を統合
  • 2CerebellumとBrainをtool callingで連携し複雑な処理に対応
  • 3雑音・複数人対話に対応しモデル・コード・データを公開

要約

Ganderは、映像・音声・テキストを連続入力し、リアルタイムの全二重対話とエージェント推論を単一フレームワークに統合したエンドツーエンドモデルとして公開された。従来のターン制と異なり、ユーザーはいつでも割り込みでき、モデルは途中経過のフィードバックや追加質問を自発的に返す。リアルタイム対話を担うCerebellumと、複雑な推論・エージェント処理を担うBrainを、tool callingとエージェント実行基盤で連携させる。Cerebellumには、入出力をチャンク単位の順序付きtoken streamへ統合するstreaming Thinker-Talker構成を採用した。会話能力、全モーダル理解、対話能力、エージェント知能を評価し、雑音、複数人対話、相づちを含む現実的な環境で堅牢性を確認した。モデル、コード、データを公開した。

あなたへの影響

音声・映像を扱うエージェント開発者は、ターン制APIだけでなく割り込み可能な全二重対話と、Cerebellum-Brain分離の実装を次の評価対象に加えるべきです。

推奨:chunk-level token streamは、入力と出力を低遅延で連続処理する設計です。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。