AIアセスメント 100,000円(税別)

詳しく見る
FDX株式会社
Tech Note

LLM API比較と料金一覧|2026年10月前半時点

業務用LLM APIを比較し、OpenAI・Anthropic・Google・Sakana AIの最新モデルの料金を公式ページで確認して一覧にしました。用途別に試す価格帯と、日本企業が確認すべきデータの扱いをFDX株式会社が整理します。

·FDX株式会社 編集部·監修: 佐藤 拓哉(生成AI協会 理事)

「どの​LLMの​APIを​使えば​いいか」と​いう​相談は、​この​半年で​答え方が​変わった。​9月だけでも、​Anthropicの​Claude Opus 5.5や​Sakana AIの​Fugu Max・Ultra v2など、​各社が​新しい​モデルと​料金を​相次いで​出しており、​3か​月前の​比較表は​もう​使えない。

一方で、​単価の​表を​1枚​並べても、実際の請求額はほとんど予測できない。​同じ​文章でも​モデルに​よって​トークン数が​変わり、​長い​資料を​渡すと​単価が​上がる​モデルが​あり、​推論に​使った​トークンは​出力と​して​請求される。

ローカルで​動かすオープンウェイトモデルは​扱わない。​そちらはローカルLLM比較2026で​比較している。

この​​記事の​​対象読者


比較の​​前提と​​表の​​読み方

各社の​料金ページは、​書き方も​課金の​単位も​揃っていない。​表を​読む前に、​次の​前提を​押さえておく。

単位と条件を揃えた。 表の​単価は​すべて、​100万トークンあたりの​米ドル、​標準処理​(Standard)、​キャッシュを​使わない​場合の​定価である。​大口の​個別割引は​含まない。

「短い文脈」の単価で並べた。 入力が​一定の​長さを​超えると​単価が​上がる​モデルが​ある。​境目と​上がった​後の​単価は、​各行の​備考と​各社の​節に​書いた。

思考のトークンは出力として請求される。 OpenAIの​推論ガイドは​推論トークンを​出力トークンと​して​請求すると​書き、​Anthropicの​ドキュメントも​思考に​使った​トークンを​出力と​して​請求すると​明記している。​Googleの​料金ページも​出力単価の​欄を​「思考トークンを​含む」と​している。画面に見える回答が短くても、出力の請求は長くなりうる。

同じ文章でもトークン数は同じではない。 Anthropicの​料金ページは、​Claude 4.7以降の​モデルが​使う​新しい​トークナイザーは、​同じ​文章に​対しておよそ​30%多く​トークンを​数えると​書いている。​モデルが​違えば​トークンの​数え方も​違う​ため、単価だけでは費用を比べられない。​最終的には​自社の​実データを​流して、​1件あたりの​請求額で​比べる​必要が​ある。


最新モデルの​​料金一覧​(2026年10月前半時点)

出力単価で​3つの​価格帯に​分けた。​境目は、​軽量帯が​出力5ドル以下、​中位帯が​6〜12ドル、​上位帯が​20ドル以上である。

主要12モデルの100万トークンあたりの単価を、対数目盛りの横軸に並べた図。各行に入力単価を白抜きの丸、出力単価を塗りつぶしの丸で描いて金額を添え、上から上位帯(GPT-6 Astra、Claude Fable 5.1、Fugu Ultra v2、Claude Opus 5.5)、中位帯(Gemini 3.1 Pro Preview、GPT-6.1 Sol、Claude Sonnet 5.5、Fugu Max)、軽量帯(Claude Haiku 4.5、Gemini 3.8 Flash、Gemini 3.5 Flash-Lite、GPT-6 Luna)の3つの帯に分けている。帯の境目は出力単価で、軽量帯が5ドル以下、中位帯が6〜12ドル、上位帯が20ドル以上。下部に「標準処理・短い文脈の単価。Gemini 3.8 Flashは2026年12月31日までの価格。各社公式ページで2026年9月29日(OpenAIは9月30日)確認」と注記がある。

表の​「試算」は、1件あたり入力3,000トークン・出力500トークンの処理を1万件流した​場合の​計算例である。​キャッシュなし、​標準処理、​短い​文脈の​単価で、​次の​式で​計算した。​実測値ではなく、​思考トークンを​含めた​出力の​長さや​トークナイザーの​違いで​実際の​額は​変わる。

試算額 = 1万件 ×​(3,000 × 入力単価 + 500 × 出力単価)​÷ 100万

OpenAIの​モデルは​料金の​条件が​多いため、​次節の​「OpenAI」の​表に​まとめた。​この​表は​Anthropic・Google・Sakana AIの​モデルである。

価格帯モデル​(API ID)入力キャッシュ入力出力試算(1万件)備考
上位Claude Fable 5.1​(claude-fable-5-1)$10.00$0.25$50.00$55030日間の​データ保持が​必須の​モデル
上位Claude Opus 5.5​(claude-opus-5-5)$4.00$0.20$20.00$220公式が​「多くの​用途で​まず試す」と​案内
上位Fugu Ultra v2​(fugu-ultra-v2.0)$5.00$0.50$30.00$300文脈272K超は​入力$10.00/出力$45.00
中位Claude Sonnet 5.5​(claude-sonnet-5-5)$2.00$0.20$10.00$1101Mトークンまで​同じ​単価
中位Gemini 3.1 Pro Preview​(gemini-3.1-pro-preview)$2.00$0.20$12.00$120プレビュー。​入力200K超は​入力$4.00/キャッシュ$0.40/出力$18.00
中位Fugu Max$2.00$0.25$6.00$90文脈の​長さに​よらず​同じ​単価
軽量Claude Haiku 4.5​(claude-haiku-4-5-20251001)$1.00$0.10$5.00$55引退は​「2026年10月15日以降」と​公表
軽量Gemini 3.8 Flash​(gemini-3.8-flash)$0.75$0.075$3.75$41.252026年12月31日までの​価格。​2027年1月から​入力$1.50/出力$7.50
軽量Gemini 3.5 Flash-Lite​(gemini-3.5-flash-lite)$0.30$0.03$2.50$21.50—

Claudeの​キャッシュ入力は​キャッシュの​読み出し単価で、​書き込みは​別料金​(5分キャッシュで​入力単価の​1.25倍、​1時間キャッシュで​2倍)である。​Geminiの​キャッシュ入力は​コンテキストキャッシュの​単価で、​別に​保存時間に​応じた​料金が​かかる。​Gemini 3.1 Pro Previewの​キャッシュ保存料は​100万トークン1時間​あたり$4.50である。​Fugu Maxの​APIでの​モデルIDは、​公式ページに​記載が​なかった。


各社の​​料金ルールと​​提供条件

単価の​表に​入りきらない​条件を、​社ごとに​まとめる。​見積もりの​誤差は、​ほとんどが​ここから​生まれる。

OpenAI:GPT-6 Astra・GPT-6.1 Sol・GPT-6 Luna

本節は、​OpenAI DevDay 2026​(日本時間9月30日)の​後に​確認した​公式ドキュメント​(料金・モデル一覧・変更履歴、​2026年9月30日確認)に​基づく。​DevDayの​発表全体はOpenAI DevDay 2026まとめで​整理している。

OpenAIの​モデル一覧は、​複雑な​推論と​コーディングには​GPT-6 Astra、​性能と​費用の​均衡には​GPT-6.1 Sol、​費用を​重視する​大量処理には​GPT-6 Lunaを​勧めている。​Astraは​9月3日、​Lunaは​9月22日、​GPT-6.1 Solは​9月29日に​APIで​公開された。​GPT-6.1 Solは​9月22日​公開の​GPT-6 Solの​改良版で、​料金ページの​表では​GPT-6 Solと​入れ替わった。​3モデルとも​文脈長​(コンテキストウィンドウ)は​1.05Mトークン、​出力の​上限は​128Kトークンである。

価格帯モデル​(API ID)入力キャッシュ入力出力試算(1万件)備考
上位GPT-6 Astra​(gpt-6-astra)$10.00$1.00$50.00$550長い​文脈は​入力$20.00/キャッシュ$2.00/出力$75.00
中位GPT-6.1 Sol​(gpt-6.1-sol)$2.00$0.10$10.00$110入力272K超は​入力$4.00/キャッシュ$0.20/出力$15.00
軽量GPT-6 Luna​(gpt-6-luna)$0.10$0.01$0.50$5.50入力272K超は​入力$0.20/キャッシュ$0.02/出力$0.75

Anthropic:Claude

Anthropicの​モデル一覧は、​迷ったら​まずClaude Opus 5.5を​多くの​用途で​試し、​それでも​足りない​難しい​推論や​長時間の​エージェント作業には​Claude Fable 5.1を​使うよう​案内している。​Opus 5.5は​2026年9月22日の​公開で、​思考​(adaptive thinking)が​常に​オンに​なっており無効に​できない。​思考の​深さは​effortで​調整する。

Haiku 4.5は、​引退の​時期が​「2026年10月15日より​前に​は​しない」と​公表されている。​軽量帯で​Haiku 4.5を​使っている​実装は、​次回​(10月16日)の​更新で​状況を​確認する。

Google:Gemini

Gemini 3.8系の​うち、​通常の​テキスト生成に​使う​モデルは​2026年9月29日​時点で​Gemini 3.8 Flashである​(ほかに​音声対話向けの​Liveと​音声合成向けの​TTSが​ある)。​Proの​系統で​料金ページに​載っているのは​Gemini 3.1 Pro Previewで、​プレビュー扱いに​なっている。

Google Cloud​(Vertex AI)​経由で​使う​場合の​料金と、​東京リージョンで​使えるか​どうかは、​今回の​確認では​公式ページから​読み取れなかった。​Google Cloudで​契約する​場合は、​Google Cloudの​料金ページと​リージョンの​一覧を​個別に​確認して​ほしい。

Sakana AI:Fugu Max・Fugu Ultra v2

Sakana AIは​2026年9月11日に​Fugu Maxと​Fugu Ultra v2を​発表した。​Fuguは​単体の​モデルではなく、複数のモデルに仕事を振り分けて組み合わせるオーケストレーションの仕組みである。​公式は、​Fugu Maxを​費用と​性能の​釣り合い​重視、​Fugu Ultra v2を​応答時間より​複雑な​推論の​質を​優先する​位置づけと​している。

発表は、​Fugu Maxの​出力単価が​Claude Sonnet 5・GPT-5.6 Terra・Kimi K3より​40〜60%低いと​しているが、​相手は​前の​世代の​モデルで、​比べているのは​出力単価だけである。​ベンチマークの​数字も、​比べた​各モデルの​設定​(推論の​強さなど)が​発表ページに​書かれていないため、​本記事では​性能の​優劣の​根拠に​使わない。


用途別:どの​​価格帯から​​試すか

各社が​公表する​ベンチマークは、​推論の​強さや​試行回数などの​条件が​揃っていない​ことが​多く、​他社との​順位づけには​使いにくい。​そこで​本記事は、性能の順位ではなく、どの価格帯から試し始めるかで整理する。

業務の用途ごとに、最初に試す価格帯と費用を決める要因、必ず測る指標を4枚のカードで示した図。「大量の分類・抽出」は軽量帯から試し、費用は件数と出力の長さで決まり、正解率と形式の遵守率を測る。「社内文書のRAG回答」は軽量帯か中位帯から試し、費用は検索で渡す文脈の量で決まり、根拠の正しさと回答不能の判定を測る。「コーディング・エージェント」は中位帯から試して難所だけ上位帯に回し、費用は往復の回数と思考トークンで決まり、タスクの完了率と1タスクあたりの総額を測る。「長文の読解」は中位帯から試し、費用は長い文脈の料金ルールで決まり、抜け漏れの有無と1文書あたりの総額を測る。下部に「編集部による判断の目安。最終判断は自社の評価セットで行う」と注記がある。
用途最初に試す帯費用を​決める​要因帯を​上げる​判断基準
大量の分類・抽出(問い​合わせの​振り分け、​帳票からの​項目抽出)軽量帯件数と​出力の​長さ。​急が​ない​処理は​Batch​(提供が​あれば​半額)自社の​ラベル付きデータで​正解率が​目標に​届かない。​形式の​崩れが​残る
社内文書のRAG回答軽量帯か中位帯検索で​渡す文脈の​量。​キャッシュの​割引が​効く根拠と​違う​回答、​答えられない​問いへの​推測回答が​許容範囲を​超える
コーディング・エージェント中位帯。​難所だけ上位帯往復の​回数、​ツール呼び出し、​思考トークンタスクの​完了率が​低く、​やり直しの​往復で​総額が​かえって​増える
長文の読解(契約書・報告書一式)中位帯長い​文脈の​料金ルール。​境目を​超えると​単価が​上がる​モデルが​ある抜け漏れや、​資料間の​矛盾の​見落としが​続く

判断のコツは、1件あたりの単価ではなく、業務1件を終えるまでの総額で​比べる​ことである。​安い​モデルで​3回やり直すより、​上の帯で​1回で​終わる​ほうが​安いことは​珍しくない。​逆に、​分類のような​短い​判断に​上位帯を​使い続けるのは、​費用の​無駄に​なりやすい。​短い​判断を​専用の​モデルやルールに​逃が​す方​法はJevとは?​判断に​特化した​AIの​使いどころ、​トークンその​ものを​減らす設計はLLMトークン節約5パターンで扱っている。

評価の​進め方は​3段階で​よい。​まず過去の​実データから​50〜100件の​評価セットを​作り、​次に​同じ​評価セットを​各帯の​候補モデルに​流して​正解率・1件あたりの​総額・応答時間を​並べ、​最後に​目標を​満たす​最も​安い帯を​選ぶ。​評価セットの​作り方はAIエージェントの​Eval設計で​詳しく​解説している。


日本企業が​​契約前に​​確認する​​こと

料金より​先に​確認すべきなのが、​データの​扱いである。​社内規程や​顧客との​契約で​「国外に​データを​出さない」​「学習に​使わせない」と​決めている​場合、​単価が​いくら安くても​使えない​モデルが​ある。

判断基準と​​確認方​​法

確認項目なぜ確認するか確認方法
推論の処理地域保存先を​国内に​できても、​推論は​国外で​行われる​場合が​ある「保存​(at rest)」と​「処理​(processing)」を​分けて​書いているかを​見る。​地域指定の​上乗せ料金も​確認する
データの​保持期間監視目的の​ログが​一定期間残る。​モデルに​よって​保持が​必須の​ものも​あるデータ管理の​ガイドで​既定の​保持期間と、​ZDRの​対象・条件を​確認する
学習への利用無料枠や​既定の​設定では​学習に​使われる​場合が​ある有料と​無料の​違い、​オプトアウトの​方法、​既定値を​確認する
クラウド経由の​提供既存の​AWS・Azure・Google Cloudの​契約と​データ管理の​枠内で​使えるモデルが​どの​クラウドで​提供されているか、​地域エンドポイントの​有無と​料金差を​各クラウドの​料金ページで​確認する
レート制限と​支出上限本番で​突然429エラーが​増える。​月の​上限に​達すると​止まる自社の​段階​(Tier)の​上限と、​上げる​条件を​確認し、​ピーク時の​流量と​比べる
モデルの​引退時期引退が​近い​モデルに​組み込むと、​短期間で​移行作業が​発生するモデル一覧の​引退予定・廃止予定の​ページを​確認し、​バージョン付きの​IDで​固定する

各社の​​現状​(2026年9月29日確認)

OpenAIの​同じ​項目は、​前節の​「OpenAI」に​まとめた。

確認項目Anthropic​(Claude API)Google​(Gemini API)Sakana AI​(Fugu)
推論の処理地域global(既定)か us。us は1.1倍公式ページで​確認できず記載なし
データの​保存地域Workspace geoは​ us のみ公式ページで​確認できず記載なし
学習への利用明示的な​許可なく​使わない有料枠は​使わない。​無料枠は​使う使われうる。​コンソールで​オプトアウト可
データ保持ZDR​あり。​Fable 5.1などは​30日保持が​必須今回は​確認していない記載なし
クラウド経由Bedrock・Google Cloud・Microsoft Foundry・Claude Platform on AWSGoogle Cloud​(料金・リージョンは​今回未確認)自社APIのみ​(OpenAI互換)
レート制限Start・Build・Scaleの​段階制。​月の​支出上限​ありプロジェクト単位。​無料枠と​Tier 1〜3記載なし

「記載なし」​「確認できず」は、​その​扱いが​ないと​いう​意味ではない。公式ページで確認できなかった項目は、契約前に営業窓口に文書で確認する。 外部の​APIに​社内データを​渡す前の​確認点はAIガバナンスと​実装セキュリティで​詳しく​整理している。​国外に​データを​出せない​業務では、​ローカルで​動かすモデルも​選択肢に​入る。​その​比較はローカルLLM比較2026を​参照して​ほしい。


FDXの​支援

FDXは​AX​(AI Transformation)の​実装パートナーと​して、​業務の​分解から​実装・現場定着・運用移管までを​支援している。

モデルの​選定で​実際に​効くのは、​料金表の​比較より、自社の業務を評価できる形に切り出し、モデルを差し替えられる構成にしておくことである。​モデルは​半月単位で​入れ替わるが、​評価セットと、​モデルを​差し替えられる​層​(ハーネスエンジニアリングとは?)を​持っていれば、​新しい​モデルが​出る​たびに​同じ​手順で​比べて​乗り換えられる。

FDXが​支援した​事例では、​ECの​問い​合わせフォームの​AI化で​月1,200件中83%を​AIが​回答する​運用を​実現した。​商社の​英語文献・社内資料の​RAG化では、​文献・​資料の​検索時間を​約70%削減している​(自社推計)。​事例の​詳細はAX導入事例で​紹介している。


よく​​ある​​質問​(FAQ)

Q1. LLMの​​API料金は​​何を​​基準に​​比べれば​​よいか?

A. 単価の​表ではなく、​業務1件を​終えるまでの​総額で​比べる。​トークン数の​数え方、​思考トークンの​請求、​長い​文脈での​単価の​上昇が​モデルごとに​違う​ためである。​過去の​実データで​評価セットを​作り、​候補の​モデルに​流して、​1件あたりの​請求額と​正解率を​並べるのが​確実である。

Q2. 一番​​安い​​モデルを​​選べば​​費用は​​下がるのではないか?

A. 下がるとは​限らない。​安い​モデルで​正解率が​足りず、​やり直しや​人の​確認が​増えると、​業務1件あたりの​総額は​かえって​上がる。​逆に、​分類のような​短い​判断に​上位の​モデルを​使い続けるのは​無駄が​大きい。​用途ごとに​最も​安い帯から​試し、​目標の​正解率に​届かない​場合だけ帯を​上げる​進め方が、​費用と​品質の​両方を​守りやすい。

Q3. 同じ​​文章なら、​​どの​​モデルでも​​トークン数は​​同じか?

A. 同じではない。​モデルごとに​トークナイザーが​違い、​Anthropicは、​Claude 4.7以降の​モデルが​同じ​文章に​対しておよそ​30%多く​トークンを​数えると​公式の​料金ページで​説明している。​単価が​同じでも、​請求額は​変わりうる。​比較する​ときは、​自社の​日本語の​文書を​実際に​流して、​請求された​トークン数を​確認する​必要が​ある。

Q4. 日本国内で​​データを​​処理できる​​LLMの​​APIは​​あるか?

A. 本記事で​確認した​各社の​直接契約の​APIでは、​日本国内での​推論処理を​指定できる​設定は​見当たらなかった。​保存先を​日本に​できる​APIでも、​推論は​国外で​行われ、​保存先の​指定自体に​不正利用​監視や​データ保持の​条件を​満たす承認が​必要な​場合が​ある。​Google Cloudや​AWSなどの​クラウド経由で​地域を​指定できる​場合も​ある​ため、​使う​モデルと​地域ごとに​各クラウドの​公式ページで​確認し、​契約前に​文書で​確かめて​ほしい。

Q5. 料金は​​どの​​くらいの​​頻度で​​変わるのか?

A. 頻繁に​変わる。​2026年9月だけでも​複数の​社が​新しい​モデルと​料金を​出しており、​Gemini 3.8 Flashのように​期間限定の​価格の​モデルも​ある。​本記事は​毎月​1日と​16日に​確認して​更新する。​本番で​使う​場合は、​料金ページと​廃止予定の​ページを​定期的に​確認する​運用を​組み込んで​おくと​よい。

Q6. ベンチマークの​​順位で​​モデルを​​選んではいけないのか?

A. 参考には​なるが、​それだけで​選ぶのは​危うい。​各社が​公表する​ベンチマークは、​推論の​強さや​試行回数などの​条件が​揃っていない​ことが​多く、​どの​設定同士の​比較かが​書かれていない​場合も​ある。​自社の​業務に​近い​評価セットで、​正解率と​1件あたりの​総額を​測った​結果の​ほうが、​選定の​根拠と​して​確かである。


次に​​読むべき記事


まとめ


出典・参考文献

※ 英語資料からの​引用・要約は​編集部に​よる​翻訳である。​価格帯の​区分、​用途別の​目安、​試算は​公開情報を​踏まえた​編集部の​整理であり、​各社が​特定の​業務での​性能や​費用を​保証する​ものではない。


更新履歴

エージェントを​「業務で​使える​品質」まで​持っていく

実装だけでなく、検証・評価設計・運用移管までを含めて設計します。動くものはできたが本番に出せない、で止まっている段階からご相談ください。