Asayomu Tech
注目★★★★★Hacker News

Claude Fable 5 vs GPT Sol、NP困難問題で徹底比較—/goal機能は奥の手か?

30秒で把握

  • 1Claude Fable 5 が NP 困難なネットワーク設計問題で GPT Sol に大勝・スコア平均 1,875 点差・結果のばらつきも 6 倍小さい
  • 2/goal モード勝率 67% も両モデルの平均スコア悪化・単発判定と全体パフォーマンスが乖離
  • 3最適化タスクでは探索継続の質が結果を左右・/goal は有効な「試行錯誤の自動延長」ではなく探索経路を根本変化させる仕様

要約

エンジニアが NP 困難な光ファイバーネットワーク設計問題でClaude Fable 5 と GPT-5.6 Sol を競わせた。Fable 5 は圧倒的に強く、平均スコアで Sol を 1,875 点上回り、結果のばらつきも極めて小さかった。/goal モード (追加推論ターンを自動判定) は個別試行の 67% で勝ったものの、両モデルともスコア平均を悪化させた。これは /goal が「もっと頑張る」スイッチではなく、探索経路そのものを変えるため、悪い選択肢を延命することもあるから。

あなたへの影響

現場で /goal 機能を有効にしたまま運用する場合、個別タスクの勝率と全体の安定性が必ずしも一致しないことに注意。

推奨:特に組合せ最適化やアルゴリズム設計が絡む業務では、Fable 5 の安定性 (319 点幅) が Sol の 1,958 点幅よりも信頼できるため、モデル選定とハイパーパラメータチューニングの優先順位を再検討する価値がある。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。