Asayomu Tech
注目★★★★Hacker News

DeepSeek v4 Flash Vision、画像解析を OpenAI 互換 API で実装可能に

30秒で把握

  • 1DeepSeek v4 Flash Vision がマルチモーダル対応・JPEG/PNG/GIF/WebP 形式サポート・3 つの画像入力方法実装
  • 2OpenAI / Anthropic / Responses API の 3 エンドポイント互換・自動リサイズ後最大 384 トークン計算・Files API 64 MiB 対応
  • 3Base64 インライン (48 MiB 制限) / 外部 URL (32 MiB) / Files API (64 MiB) を用途に応じて選択・トークン推定ツル活用推奨

要約

DeepSeek が deepseek-v4-flash-vision-exp モデルを公開し、テキストと画像を同時に処理できる視覚能力を追加した。JPEG / PNG / GIF / WebP の 4 形式に対応し、Base64 インライン、外部 URL、Files API の 3 つの方法で画像入力が可能。OpenAI 互換の Chat Completions エンドポイント、Anthropic 互換の messages エンドポイント、Responses API で利用でき、画像は自動リサイズ後に最大 384 トークンまで換算される。Files API では 64 MiB まで対応し、リクエスト本体の 48 MiB 制限を超える場合に利用推奨。

あなたへの影響

DeepSeek の視覚機能が OpenAI / Anthropic API 互換で提供されるため、既存の統合実装を最小限の変更で DeepSeek に切り替え可能になり、API 選択の自由度が高まる。

推奨:画像処理コストを検討する際は自動リサイズ後のトークン換算ルール (最大 384 トークン / 画像) と Files API の 64 MiB 上限を把握した上で、複数リクエストでの画像再利用戦略を評価する価値がある。

詳細を読む → 元記事へ※ 本文は元記事をご確認ください (asayomu は要約のみ提供)

関連する記事

※ 外部記事の権利は原著作者に帰属します。著作権削除要請は copyright@asayomu.jp までご連絡ください(受領確認 24h・実処理 72h 以内)。