注目★★★★★Hacker News
NVIDIA、軽量推論モデル Nemotron 3.5 Lightning と智能ルーティング Switchyard を公開
30秒で把握
- 1NVIDIA が Nemotron 3.5 Lightning (30B パラメータ) 公開・従来比 4 倍高速・タスク完了 30% 短縮
- 2NeMo Switchyard により複数モデルを自動ルーティング・Opus 4.8 単体比でコスト 3 分の 1 達成
- 3CrowdStrike・Harvey・CodeRabbit など業界パートナーがカスタマイズ・Hugging Face 等で公開
要約
NVIDIA は自律エージェント時代に向け、30 億パラメータの混合エキスパートモデル Nemotron 3.5 Lightning を公開した。従来比 4 倍高速で同クラス比 30% 短時間でタスク完了でき、RTX PC から DGX・クラウドまで幅広く展開できる。同時に公開した NeMo Switchyard はオープンソースのモデルルーティングライブラリで、複数モデルを組み合わせた構成で各リクエストを最適なモデルに自動振り分け、Opus 4.8 単体比で約 3 分の 1 のコストに削減できる。CrowdStrike・Harvey・CodeRabbit など業界リーダーが既にカスタマイズしており、両ツールで AI 運用の効率化と自社インフラへの制御を実現する。
あなたへの影響
自律エージェント構成で複数モデルを組み合わせる場合、Nemotron 3.5 Lightning + NeMo Switchyard でコスト削減と応答速度を両立できる。
推奨:自社ドメイン向けにカスタマイズ・ファインチューニングでき、ローカルと cloud を柔軟に組み合わせられるため、AI 本番運用のコスト最適化を検討中のチームは評価する価値がある。