注目★★★★★Hacker News
AI が AI を学習させるエージェントを RL で訓練、約 $1.3k で実現
30秒で把握
- 1RL ループ内のエージェントが内側の RL ループで小規模モデルを訓練・報酬が 0.0 → 0.63 に上昇
- 2未訓練タスクへの転移で性能維持を確認・全コード・学習済みローラとインフラが公開状態
- 3総費用 $1.3k・16 GPU ポッド・約 1,750 実ジョブで実装・GitHub で再現・拡張可能
要約
開発者が RL ループ内で動作するエージェントを構築・訓練し、そのエージェント自身が小規模モデルを RL で学習させるシステムを完成させた。外側のループで Tinker を用いてエージェントを訓練し、報酬は内側のループで学習されたモデルの精度向上で設計し、54 ステップで報酬を 0.0 から 0.63 へ上昇させた。未訓練のタスクファミリーへの転移学習でも性能が維持され、全コード・学習済みローラアダプタ・インフラ設定が公開されている。
あなたへの影響
自動機械学習 (AutoML) やハイパーパラメータ最適化の新しいアプローチとして注視の価値がある。
推奨:ただし実装の複雑度が高く、再現にはクラウド GPU リソースと RL インフラの構築が必須のため、導入検討時は総コストと習得期間を慎重に評価する必要がある。