「どのLLMのAPIを使えばいいか」という相談は、この半年で答え方が変わった。9月だけでも、AnthropicのClaude Opus 5.5やSakana AIのFugu Max・Ultra v2など、各社が新しいモデルと料金を相次いで出しており、3か月前の比較表はもう使えない。
一方で、単価の表を1枚並べても、実際の請求額はほとんど予測できない。同じ文章でもモデルによってトークン数が変わり、長い資料を渡すと単価が上がるモデルがあり、推論に使ったトークンは出力として請求される。
- 本記事は、業務で使うクラウドのLLM APIを、各社の公式料金ページとモデル一覧だけを出典に比較する。数値は2026年9月29日(OpenAIはDevDay後の9月30日)に確認した
- 表は1モデル1行にし、毎月1日と16日に更新する。更新の記録は末尾の「更新履歴」に残す
- モデルを出力単価で軽量帯・中位帯・上位帯の3つに分け、用途ごとに「どの帯から試すか」の目安を示す
- 日本企業が契約前に確認すべき、データの処理地域・保持・学習利用・クラウド経由の提供・レート制限を各社の公式ドキュメントで確認した範囲で整理する
ローカルで動かすオープンウェイトモデルは扱わない。そちらはローカルLLM比較2026で比較している。
この記事の対象読者
- 生成AIを組み込んだ業務システムを作っていて、使うモデルとAPIの費用を見積もる必要がある開発者・PM
- 複数社のAPIを併用していて、最新の料金と提供条件を半月ごとに確認したい実装担当者
- 情報システム部門として、外部APIに社内データを渡す前にデータの扱いを確認したい方
- 稟議のために、1件あたり・月あたりの費用の根拠を示す必要がある推進担当者
比較の前提と表の読み方
各社の料金ページは、書き方も課金の単位も揃っていない。表を読む前に、次の前提を押さえておく。
単位と条件を揃えた。 表の単価はすべて、100万トークンあたりの米ドル、標準処理(Standard)、キャッシュを使わない場合の定価である。大口の個別割引は含まない。
「短い文脈」の単価で並べた。 入力が一定の長さを超えると単価が上がるモデルがある。境目と上がった後の単価は、各行の備考と各社の節に書いた。
思考のトークンは出力として請求される。 OpenAIの推論ガイドは推論トークンを出力トークンとして請求すると書き、Anthropicのドキュメントも思考に使ったトークンを出力として請求すると明記している。Googleの料金ページも出力単価の欄を「思考トークンを含む」としている。画面に見える回答が短くても、出力の請求は長くなりうる。
同じ文章でもトークン数は同じではない。 Anthropicの料金ページは、Claude 4.7以降のモデルが使う新しいトークナイザーは、同じ文章に対しておよそ30%多くトークンを数えると書いている。モデルが違えばトークンの数え方も違うため、単価だけでは費用を比べられない。最終的には自社の実データを流して、1件あたりの請求額で比べる必要がある。
最新モデルの料金一覧(2026年10月前半時点)
出力単価で3つの価格帯に分けた。境目は、軽量帯が出力5ドル以下、中位帯が6〜12ドル、上位帯が20ドル以上である。
表の「試算」は、1件あたり入力3,000トークン・出力500トークンの処理を1万件流した場合の計算例である。キャッシュなし、標準処理、短い文脈の単価で、次の式で計算した。実測値ではなく、思考トークンを含めた出力の長さやトークナイザーの違いで実際の額は変わる。
試算額 = 1万件 ×(3,000 × 入力単価 + 500 × 出力単価)÷ 100万
OpenAIのモデルは料金の条件が多いため、次節の「OpenAI」の表にまとめた。この表はAnthropic・Google・Sakana AIのモデルである。
| 価格帯 | モデル(API ID) | 入力 | キャッシュ入力 | 出力 | 試算(1万件) | 備考 |
|---|---|---|---|---|---|---|
| 上位 | Claude Fable 5.1(claude-fable-5-1) | $10.00 | $0.25 | $50.00 | $550 | 30日間のデータ保持が必須のモデル |
| 上位 | Claude Opus 5.5(claude-opus-5-5) | $4.00 | $0.20 | $20.00 | $220 | 公式が「多くの用途でまず試す」と案内 |
| 上位 | Fugu Ultra v2(fugu-ultra-v2.0) | $5.00 | $0.50 | $30.00 | $300 | 文脈272K超は入力$10.00/出力$45.00 |
| 中位 | Claude Sonnet 5.5(claude-sonnet-5-5) | $2.00 | $0.20 | $10.00 | $110 | 1Mトークンまで同じ単価 |
| 中位 | Gemini 3.1 Pro Preview(gemini-3.1-pro-preview) | $2.00 | $0.20 | $12.00 | $120 | プレビュー。入力200K超は入力$4.00/キャッシュ$0.40/出力$18.00 |
| 中位 | Fugu Max | $2.00 | $0.25 | $6.00 | $90 | 文脈の長さによらず同じ単価 |
| 軽量 | Claude Haiku 4.5(claude-haiku-4-5-20251001) | $1.00 | $0.10 | $5.00 | $55 | 引退は「2026年10月15日以降」と公表 |
| 軽量 | Gemini 3.8 Flash(gemini-3.8-flash) | $0.75 | $0.075 | $3.75 | $41.25 | 2026年12月31日までの価格。2027年1月から入力$1.50/出力$7.50 |
| 軽量 | Gemini 3.5 Flash-Lite(gemini-3.5-flash-lite) | $0.30 | $0.03 | $2.50 | $21.50 | — |
Claudeのキャッシュ入力はキャッシュの読み出し単価で、書き込みは別料金(5分キャッシュで入力単価の1.25倍、1時間キャッシュで2倍)である。Geminiのキャッシュ入力はコンテキストキャッシュの単価で、別に保存時間に応じた料金がかかる。Gemini 3.1 Pro Previewのキャッシュ保存料は100万トークン1時間あたり$4.50である。Fugu MaxのAPIでのモデルIDは、公式ページに記載がなかった。
各社の料金ルールと提供条件
単価の表に入りきらない条件を、社ごとにまとめる。見積もりの誤差は、ほとんどがここから生まれる。
OpenAI:GPT-6 Astra・GPT-6.1 Sol・GPT-6 Luna
本節は、OpenAI DevDay 2026(日本時間9月30日)の後に確認した公式ドキュメント(料金・モデル一覧・変更履歴、2026年9月30日確認)に基づく。DevDayの発表全体はOpenAI DevDay 2026まとめで整理している。
OpenAIのモデル一覧は、複雑な推論とコーディングにはGPT-6 Astra、性能と費用の均衡にはGPT-6.1 Sol、費用を重視する大量処理にはGPT-6 Lunaを勧めている。Astraは9月3日、Lunaは9月22日、GPT-6.1 Solは9月29日にAPIで公開された。GPT-6.1 Solは9月22日公開のGPT-6 Solの改良版で、料金ページの表ではGPT-6 Solと入れ替わった。3モデルとも文脈長(コンテキストウィンドウ)は1.05Mトークン、出力の上限は128Kトークンである。
| 価格帯 | モデル(API ID) | 入力 | キャッシュ入力 | 出力 | 試算(1万件) | 備考 |
|---|---|---|---|---|---|---|
| 上位 | GPT-6 Astra(gpt-6-astra) | $10.00 | $1.00 | $50.00 | $550 | 長い文脈は入力$20.00/キャッシュ$2.00/出力$75.00 |
| 中位 | GPT-6.1 Sol(gpt-6.1-sol) | $2.00 | $0.10 | $10.00 | $110 | 入力272K超は入力$4.00/キャッシュ$0.20/出力$15.00 |
| 軽量 | GPT-6 Luna(gpt-6-luna) | $0.10 | $0.01 | $0.50 | $5.50 | 入力272K超は入力$0.20/キャッシュ$0.02/出力$0.75 |
- 短い文脈と長い文脈で単価が違う。 SolとLunaの短い文脈の単価は、変更履歴で「入力272Kトークンまで」と定義されている。超えると入力とキャッシュ入力が2倍、出力が1.5倍になる。Astraも料金ページで単価が2段に分かれているが、境目のトークン数は料金ページにも変更履歴にも書かれていなかった
- キャッシュの書き込みにも料金がかかる。 短い文脈で、Astraは$12.50、GPT-6.1 Solは$2.50、Lunaは$0.125(いずれも100万トークンあたり)
- GPT-6.1 Solはキャッシュ入力が安く、推論を切れない。 キャッシュ入力はGPT-6 Solの$0.20から$0.10(通常入力の5%)に下がった。一方で、推論設定の
noneとminimalに対応しておらず、Chat Completionsではツールを呼べない。GPT-6 Solで推論を切っていた処理を移すと、推論の分だけ出力トークンが増えうる - 処理の種類で単価が変わる。 Batch(非同期の一括処理)とFlexは標準の半額、Fast mode(2026年7月30日にPriority processingから改称)は標準の2倍である。DevDayで新設されたUltrafastは、一般提供がGPT-6 Astraのみで、単価は標準の6倍である(公式ガイドは、GPT-5.6 Solを営業窓口経由のプレビューとしている)
- データの扱い。 APIに送ったデータは、利用者が明示的に共有を選ばない限り学習に使わないと公式ガイドに書かれている。不正利用の監視ログは既定で最大30日保持される。ゼロデータ保持(ZDR)の対象になるエンドポイントも一覧で示されている
- 日本の扱い(利用条件)。 データ所在地の地域に日本があり、
jp.api.openai.comで保存先を日本にできる。ただし使えるかはモデルごとに異なり、GPT-6.1 Solのデータレジデンシーは米国とEUのみである。また日本は保存のみの対応で、推論の地域処理には対応していない(地域処理は米国・欧州・UAE)。利用には、不正利用監視の制御(Modified Abuse Monitoring)かZDRの承認と、保持条件を変更する契約(Modified Retention amendment)が必要とされている - データ所在地の課金条件。 料金ページは、2026年3月5日以降に公開された対象モデルについて、地域処理(データ所在地)のエンドポイントに10%の上乗せがかかると書いている。保存のみの日本のエンドポイントがこの上乗せの対象になるかは、料金ページとデータ管理のガイドの記述だけでは読み切れなかったため、契約前に確認する
- クラウド経由。 2026年6月からAmazon BedrockでOpenAIのモデルが提供されている。9月30日時点の料金ページは、Amazon BedrockとMicrosoft Azure経由のOpenAIのモデルはそれぞれのサービスで請求されるとして、各社の料金ページを案内している(9月28日時点にあった「Bedrockの商用リージョンの料金は直接契約と同じ」という記載は無くなった)。GPT-6の各モデルが使えるかと単価は、AWS・Azure側の一覧で確認が必要である
- レート制限。 支払い実績に応じたTier 1〜5の段階があり、組織単位とプロジェクト単位で上限が決まる。9月2日からは、急な流量増加(429の
slow_down)と一時的な過負荷(503のserver_is_overloaded)がエラーで区別されるようになった
Anthropic:Claude
Anthropicのモデル一覧は、迷ったらまずClaude Opus 5.5を多くの用途で試し、それでも足りない難しい推論や長時間のエージェント作業にはClaude Fable 5.1を使うよう案内している。Opus 5.5は2026年9月22日の公開で、思考(adaptive thinking)が常にオンになっており無効にできない。思考の深さはeffortで調整する。
- 長い文脈の上乗せがない。 Claude 4.6以降のモデルは、1Mトークンの文脈全体を標準単価で使えると明記されている。90万トークンのリクエストも9,000トークンのリクエストも、トークンあたりの単価は同じである
- キャッシュの割引が大きいモデルがある。 キャッシュの読み出しは通常は入力単価の10%だが、Opus 5.5は5%、Fable 5.1は2.5%に設定されている。同じ資料を何度も読ませるRAGやエージェントでは、この差が効く
- Batch APIは入出力とも半額。 Fast mode(研究プレビュー)はOpus 5.5で入力$8/出力$40と、標準の2倍になる
- データの処理地域。
inference_geoで推論の場所を指定できるが、選べるのはglobal(既定)とusの2つだけで、usを指定すると全トークンが1.1倍になる。保存先の地域(Workspace geo)も現時点でusのみである。日本を指定する設定は、ドキュメント上に見当たらなかった - データ保持。 保持したデータを明示的な許可なく学習に使わないと明記している。ただしFable 5.1などは30日間のデータ保持が必須の対象モデルで、ZDRは原則として使えない
- クラウド経由。 現行の4モデル(Fable 5.1・Opus 5.5・Sonnet 5.5・Haiku 4.5)には、Amazon Bedrock、Google Cloud、Microsoft FoundryのモデルIDが公開されている。Foundryと「Claude Platform on AWS」は直接契約と同じ単価で、各クラウドの請求にまとめられる。BedrockとGoogle Cloudは各クラウドが料金を決め、Anthropicの料金ページは、地域を固定するエンドポイントにはグローバルより10%上乗せがかかると書いている
- レート制限。 Start・Build・Scaleの段階があり、月の支出上限はそれぞれ500ドル、1,000ドル、20万ドルである。Opus 5.5はStartの段階で毎分入力200万トークン・出力40万トークンが上限で、キャッシュから読んだトークンは入力の上限に数えない
Haiku 4.5は、引退の時期が「2026年10月15日より前にはしない」と公表されている。軽量帯でHaiku 4.5を使っている実装は、次回(10月16日)の更新で状況を確認する。
Google:Gemini
Gemini 3.8系のうち、通常のテキスト生成に使うモデルは2026年9月29日時点でGemini 3.8 Flashである(ほかに音声対話向けのLiveと音声合成向けのTTSがある)。Proの系統で料金ページに載っているのはGemini 3.1 Pro Previewで、プレビュー扱いになっている。
- Gemini 3.8 Flashは期間限定の価格。 2026年12月31日まで入力$0.75/出力$3.75で、2027年1月1日から入力$1.50/出力$7.50と2倍になる。年をまたぐ予算は、2027年の単価で見積もる必要がある
- 入力の上限は1,048,576トークン、出力の上限は65,536トークン。 長い文書を一度に生成させる用途では、出力の上限を先に確認する
- 処理の種類。 BatchとFlexは入出力とも標準の半額、Priorityは80%増しである
- 長い文脈。 Gemini 3.1 Pro Previewは、プロンプトが200Kトークンを超えると入力が2倍、出力が1.5倍になる
- データの扱い。 料金ページには、無料枠の内容は製品の改善に使われ、有料枠の内容は使われないと書かれている。業務データを試験的に流す場合でも、無料枠は使わない
- 検索によるグラウンディング。 Gemini 3.x全体で月5,000回まで無料、超えると1,000回あたり14ドル
- レート制限。 プロジェクト単位で、無料枠とTier 1〜3がある。Tier 2は支払い100ドルかつ初回支払いから3日、Tier 3は支払い1,000ドルかつ30日が条件である。1日の上限は太平洋時間の午前0時に戻る
Google Cloud(Vertex AI)経由で使う場合の料金と、東京リージョンで使えるかどうかは、今回の確認では公式ページから読み取れなかった。Google Cloudで契約する場合は、Google Cloudの料金ページとリージョンの一覧を個別に確認してほしい。
Sakana AI:Fugu Max・Fugu Ultra v2
Sakana AIは2026年9月11日にFugu MaxとFugu Ultra v2を発表した。Fuguは単体のモデルではなく、複数のモデルに仕事を振り分けて組み合わせるオーケストレーションの仕組みである。公式は、Fugu Maxを費用と性能の釣り合い重視、Fugu Ultra v2を応答時間より複雑な推論の質を優先する位置づけとしている。
- APIはOpenAI互換。 既存のFugu利用者は、パラメータを1行変えれば切り替えられると発表で説明している
- Fugu Maxは文脈の長さによらず単価が同じ。 Web検索・取得のツールは1回0.007ドル
- Fugu Ultra v2は文脈が272Kトークンを超えると単価が上がる。 入力$10.00/出力$45.00/キャッシュ入力$1.00
- 中で使うモデルは開示されない。 どのモデルを選び、どう組み合わせたかは設計上公開しないと明記している。出力の根拠をモデル単位で説明する必要がある業務では、この点を先に確認する
- 学習利用はオプトアウト方式。 利用データは性能改善に使われうるが、コンソールからいつでも学習利用を止められると書かれている。契約したら最初に設定を確認する
- 提供地域。 EU・EEAでは提供していない。データの保持期間と処理地域は、公式ページに記載がなかった
発表は、Fugu Maxの出力単価がClaude Sonnet 5・GPT-5.6 Terra・Kimi K3より40〜60%低いとしているが、相手は前の世代のモデルで、比べているのは出力単価だけである。ベンチマークの数字も、比べた各モデルの設定(推論の強さなど)が発表ページに書かれていないため、本記事では性能の優劣の根拠に使わない。
用途別:どの価格帯から試すか
各社が公表するベンチマークは、推論の強さや試行回数などの条件が揃っていないことが多く、他社との順位づけには使いにくい。そこで本記事は、性能の順位ではなく、どの価格帯から試し始めるかで整理する。
| 用途 | 最初に試す帯 | 費用を決める要因 | 帯を上げる判断基準 |
|---|---|---|---|
| 大量の分類・抽出(問い合わせの振り分け、帳票からの項目抽出) | 軽量帯 | 件数と出力の長さ。急がない処理はBatch(提供があれば半額) | 自社のラベル付きデータで正解率が目標に届かない。形式の崩れが残る |
| 社内文書のRAG回答 | 軽量帯か中位帯 | 検索で渡す文脈の量。キャッシュの割引が効く | 根拠と違う回答、答えられない問いへの推測回答が許容範囲を超える |
| コーディング・エージェント | 中位帯。難所だけ上位帯 | 往復の回数、ツール呼び出し、思考トークン | タスクの完了率が低く、やり直しの往復で総額がかえって増える |
| 長文の読解(契約書・報告書一式) | 中位帯 | 長い文脈の料金ルール。境目を超えると単価が上がるモデルがある | 抜け漏れや、資料間の矛盾の見落としが続く |
判断のコツは、1件あたりの単価ではなく、業務1件を終えるまでの総額で比べることである。安いモデルで3回やり直すより、上の帯で1回で終わるほうが安いことは珍しくない。逆に、分類のような短い判断に上位帯を使い続けるのは、費用の無駄になりやすい。短い判断を専用のモデルやルールに逃がす方法はJevとは?判断に特化したAIの使いどころ、トークンそのものを減らす設計はLLMトークン節約5パターンで扱っている。
評価の進め方は3段階でよい。まず過去の実データから50〜100件の評価セットを作り、次に同じ評価セットを各帯の候補モデルに流して正解率・1件あたりの総額・応答時間を並べ、最後に目標を満たす最も安い帯を選ぶ。評価セットの作り方はAIエージェントのEval設計で詳しく解説している。
日本企業が契約前に確認すること
料金より先に確認すべきなのが、データの扱いである。社内規程や顧客との契約で「国外にデータを出さない」「学習に使わせない」と決めている場合、単価がいくら安くても使えないモデルがある。
判断基準と確認方法
| 確認項目 | なぜ確認するか | 確認方法 |
|---|---|---|
| 推論の処理地域 | 保存先を国内にできても、推論は国外で行われる場合がある | 「保存(at rest)」と「処理(processing)」を分けて書いているかを見る。地域指定の上乗せ料金も確認する |
| データの保持期間 | 監視目的のログが一定期間残る。モデルによって保持が必須のものもある | データ管理のガイドで既定の保持期間と、ZDRの対象・条件を確認する |
| 学習への利用 | 無料枠や既定の設定では学習に使われる場合がある | 有料と無料の違い、オプトアウトの方法、既定値を確認する |
| クラウド経由の提供 | 既存のAWS・Azure・Google Cloudの契約とデータ管理の枠内で使える | モデルがどのクラウドで提供されているか、地域エンドポイントの有無と料金差を各クラウドの料金ページで確認する |
| レート制限と支出上限 | 本番で突然429エラーが増える。月の上限に達すると止まる | 自社の段階(Tier)の上限と、上げる条件を確認し、ピーク時の流量と比べる |
| モデルの引退時期 | 引退が近いモデルに組み込むと、短期間で移行作業が発生する | モデル一覧の引退予定・廃止予定のページを確認し、バージョン付きのIDで固定する |
各社の現状(2026年9月29日確認)
OpenAIの同じ項目は、前節の「OpenAI」にまとめた。
| 確認項目 | Anthropic(Claude API) | Google(Gemini API) | Sakana AI(Fugu) |
|---|---|---|---|
| 推論の処理地域 | global(既定)か us。us は1.1倍 | 公式ページで確認できず | 記載なし |
| データの保存地域 | Workspace geoは us のみ | 公式ページで確認できず | 記載なし |
| 学習への利用 | 明示的な許可なく使わない | 有料枠は使わない。無料枠は使う | 使われうる。コンソールでオプトアウト可 |
| データ保持 | ZDRあり。Fable 5.1などは30日保持が必須 | 今回は確認していない | 記載なし |
| クラウド経由 | Bedrock・Google Cloud・Microsoft Foundry・Claude Platform on AWS | Google Cloud(料金・リージョンは今回未確認) | 自社APIのみ(OpenAI互換) |
| レート制限 | Start・Build・Scaleの段階制。月の支出上限あり | プロジェクト単位。無料枠とTier 1〜3 | 記載なし |
「記載なし」「確認できず」は、その扱いがないという意味ではない。公式ページで確認できなかった項目は、契約前に営業窓口に文書で確認する。 外部のAPIに社内データを渡す前の確認点はAIガバナンスと実装セキュリティで詳しく整理している。国外にデータを出せない業務では、ローカルで動かすモデルも選択肢に入る。その比較はローカルLLM比較2026を参照してほしい。
FDXの支援
FDXはAX(AI Transformation)の実装パートナーとして、業務の分解から実装・現場定着・運用移管までを支援している。
モデルの選定で実際に効くのは、料金表の比較より、自社の業務を評価できる形に切り出し、モデルを差し替えられる構成にしておくことである。モデルは半月単位で入れ替わるが、評価セットと、モデルを差し替えられる層(ハーネスエンジニアリングとは?)を持っていれば、新しいモデルが出るたびに同じ手順で比べて乗り換えられる。
FDXが支援した事例では、ECの問い合わせフォームのAI化で月1,200件中83%をAIが回答する運用を実現した。商社の英語文献・社内資料のRAG化では、文献・資料の検索時間を約70%削減している(自社推計)。事例の詳細はAX導入事例で紹介している。
- どの業務にどの帯のモデルを使うかを業務の棚卸しから決めたい場合は、FDX Expert(AIアセスメント)
- 業務フローの再設計とあわせてAIを組み込みたい場合は、FDX BPR
- まず自社の現状を把握したい場合は、AX診断
よくある質問(FAQ)
Q1. LLMのAPI料金は何を基準に比べればよいか?
A. 単価の表ではなく、業務1件を終えるまでの総額で比べる。トークン数の数え方、思考トークンの請求、長い文脈での単価の上昇がモデルごとに違うためである。過去の実データで評価セットを作り、候補のモデルに流して、1件あたりの請求額と正解率を並べるのが確実である。
Q2. 一番安いモデルを選べば費用は下がるのではないか?
A. 下がるとは限らない。安いモデルで正解率が足りず、やり直しや人の確認が増えると、業務1件あたりの総額はかえって上がる。逆に、分類のような短い判断に上位のモデルを使い続けるのは無駄が大きい。用途ごとに最も安い帯から試し、目標の正解率に届かない場合だけ帯を上げる進め方が、費用と品質の両方を守りやすい。
Q3. 同じ文章なら、どのモデルでもトークン数は同じか?
A. 同じではない。モデルごとにトークナイザーが違い、Anthropicは、Claude 4.7以降のモデルが同じ文章に対しておよそ30%多くトークンを数えると公式の料金ページで説明している。単価が同じでも、請求額は変わりうる。比較するときは、自社の日本語の文書を実際に流して、請求されたトークン数を確認する必要がある。
Q4. 日本国内でデータを処理できるLLMのAPIはあるか?
A. 本記事で確認した各社の直接契約のAPIでは、日本国内での推論処理を指定できる設定は見当たらなかった。保存先を日本にできるAPIでも、推論は国外で行われ、保存先の指定自体に不正利用監視やデータ保持の条件を満たす承認が必要な場合がある。Google CloudやAWSなどのクラウド経由で地域を指定できる場合もあるため、使うモデルと地域ごとに各クラウドの公式ページで確認し、契約前に文書で確かめてほしい。
Q5. 料金はどのくらいの頻度で変わるのか?
A. 頻繁に変わる。2026年9月だけでも複数の社が新しいモデルと料金を出しており、Gemini 3.8 Flashのように期間限定の価格のモデルもある。本記事は毎月1日と16日に確認して更新する。本番で使う場合は、料金ページと廃止予定のページを定期的に確認する運用を組み込んでおくとよい。
Q6. ベンチマークの順位でモデルを選んではいけないのか?
A. 参考にはなるが、それだけで選ぶのは危うい。各社が公表するベンチマークは、推論の強さや試行回数などの条件が揃っていないことが多く、どの設定同士の比較かが書かれていない場合もある。自社の業務に近い評価セットで、正解率と1件あたりの総額を測った結果のほうが、選定の根拠として確かである。
次に読むべき記事
- ローカルLLM比較2026|オープンウェイトモデルの選び方 — クラウドに出せないデータを扱う場合の選択肢
- LLMトークン節約5パターン — 同じモデルのまま費用を下げる設計
- AIエージェントのEval設計|評価セットの作り方 — モデルを比べるための評価セットの作り方
- AIガバナンスと実装セキュリティ|6つの制御点 — 外部APIにデータを渡す前の確認点
- Jevとは?判断に特化したAIの使いどころ — 短い判断をLLMから切り出す方法
まとめ
- 業務用のLLM APIは、2026年9月に各社の新モデルと料金が出そろい、3か月前の比較表は使えない。本記事は各社の公式ページだけを出典に、毎月1日と16日に更新する
- 単価の表だけでは請求額は予測できない。思考トークンは出力として請求され、トークナイザーの違いで同じ文章でもトークン数が変わり、長い文脈で単価が上がるモデルがある
- 出力単価で軽量帯・中位帯・上位帯の3つに分け(境目は5ドル以下・6〜12ドル・20ドル以上)、分類・抽出は軽量帯、RAGは軽量〜中位帯、コーディング・エージェントと長文読解は中位帯から試す
- 帯を上げるかどうかは、自社の評価セットでの正解率と業務1件あたりの総額で決める
- 日本企業は料金より先に、推論の処理地域・データ保持・学習利用・クラウド経由の提供・レート制限を確認する。公式ページで確認できない項目は、契約前に文書で確かめる
- 期間限定の価格やモデルの引退予定があるため、バージョン付きのIDで固定し、料金と廃止予定を定期的に確認する運用を組み込む
出典・参考文献
- OpenAI「Pricing」(GPT-6 Astra・GPT-6.1 Sol・GPT-6 Lunaの短い文脈・長い文脈の単価、キャッシュ書き込み、Batch・Flex・Fast mode・Ultrafast、データ所在地の上乗せ、クラウド経由の請求。2026年9月28日保存、9月30日確認)
- OpenAI「Changelog」(GPT-6 Astra・Sol・Luna・GPT-6.1 Solの公開日、短い文脈が入力272Kトークンまでであること、Fast modeへの改称、Bedrockでの提供開始、エラーコードの変更。2026年9月30日確認)
- OpenAI「Models」「GPT-6.1 Sol」(各モデルの位置づけ、文脈長、出力上限、GPT-6.1 Solの推論設定と272K超の単価。2026年9月30日確認)
- OpenAI「Your data」(学習利用、監視ログの保持、ZDR、データ所在地と日本の扱い、日本の保存先を使うためのMAMまたはZDRの要件。2026年9月29日確認)
- OpenAI「Rate limits」「Reasoning models」(利用段階とレート制限、推論トークンの課金。2026年9月29日確認)
- Anthropic「Pricing」(Claude各モデルの単価、キャッシュ、Batch、Fast mode、長い文脈、データ所在地、クラウド経由の料金、トークナイザー。2026年9月29日確認)
- Anthropic「Models overview」「Claude Opus 5.5」(モデルID、各クラウドのID、文脈長、引退予定、Opus 5.5の公開日と思考の扱い。2026年9月29日確認)
- Anthropic「Data residency」「API and data retention」(推論地域と保存地域、ZDR、30日保持が必須のモデル。2026年9月29日確認)
- Anthropic「Rate limits」「Steering thinking」(利用段階と支出上限、キャッシュとレート制限、思考トークンの課金。2026年9月29日確認)
- Google「Gemini API Pricing」(Gemini 3.8 Flash・3.5 Flash-Lite・3.1 Pro Previewの単価とキャッシュ単価、期間限定価格、Batch・Flex・Priority、有料枠と無料枠のデータの扱い。ページの最終更新2026年9月24日、2026年9月29日確認)
- Google「Gemini models」「Gemini 3.8 Flash」「Rate limits」(モデルの一覧と提供状態、入出力の上限、利用段階。2026年9月29日確認)
- Sakana AI「Fugu Max・Fugu Ultra v2 の発表」(2026年9月11日。位置づけ、Fugu Maxの単価、比較の主張と注記。2026年9月29日確認)
- Sakana AI「Sakana Fugu」(各プランの単価、272K超の単価、学習利用のオプトアウト、提供地域、中で使うモデルの非開示。2026年9月29日確認)
※ 英語資料からの引用・要約は編集部による翻訳である。価格帯の区分、用途別の目安、試算は公開情報を踏まえた編集部の整理であり、各社が特定の業務での性能や費用を保証するものではない。
更新履歴
- 2026年10月2日:初版公開(2026年10月前半時点。各社の公式ページは2026年9月29日、OpenAIはDevDay後の9月30日に確認)