注目★★★★★Hacker News
LLM 選定で「100万トークン当たり価格」だけ見ると失敗する理由
30秒で把握
- 1各 LLM 企業の独自トークナイザーにより同じ入力の分割量が異なり、トークン単価での比較は不可能と指摘
- 2思考プロセス(CoT)など隠れた内部トークン消費がコストを左右し、タスク当たり実コストが単価と乖離
- 3GPT-5.5 の方が高単価だが実タスク効率は Claude 比 50% 程度に低減、モデル選定は単価ではなく実コスト測定で判断
要約
LLM の価格比較で「$X/100万トークン」という指標が意味を持たないと論じた記事。各企業の独自トークナイザーにより同じテキストでも分割量が異なる上、「思考プロセス(CoT)」など非表示の内部トークン消費が課金に含まれるため、トークン単価が低くても実際の処理効率(タスク当たり実コスト)が高い場合がある。GPT-5.5 は名目価格ではClaude Opus 4.8 より高いが、タスク当たりコストはほぼ半額に抑えられると述べた。
あなたへの影響
社内で AI サービス導入時のコスト評価を行うチームは、単価比較ではなく想定タスク(長文処理・推論反復・レスポンス時間)での実運用コスト試算を必ず実施すべき。
推奨:トークナイザー仕様の差異やCoT消費量は各ベンダーに問い合わせ、パイロット検証で確認する価値がある。