Claude Opus 5 がリリース!Fable 5 に迫る知性を Opus の価格で

2026-07-25
29分で読了
更新: 2026-07-25
claude-opus-5.webp

目次

こんにちは。2026年7月24日、Anthropic から「Claude Opus 5」が公開されました。

先月、Opus の上のクラスである Mythos-class が Claude Fable 5 として一般提供された話を書いたばかりです。あのときは「ついに手が届く」という高揚感がありましたが、正直なところ、価格が $10 / $50 という水準だったので、日常の作業をすべて Fable 5 に寄せるのは少し勇気が要りました。実際、僕も Workflow をぶん回して Rate Limit にぶつかった話を書きましたね。

今回の Opus 5 は、まさにその悩みに答えるモデルです。公式アナウンスの一行目にこう書かれています。

It's a thoughtful and proactive model that comes close to the frontier intelligence of Claude Fable 5 at half the price.

意訳すると、「思慮深く、能動的に動くモデルで、Claude Fable 5 の最先端の知性に半額で迫る」という内容です。しかも料金は Opus 4.8 から据え置きの $5 / $25。つまり、値段はそのままで、上のクラスに近いところまで来た、という発表です。

この記事では 公式アナウンス をベースに、Opus 5 の特徴と、日々の開発にどう効いてくるのかを整理していきます。

Opus 5 の立ち位置

まず押さえておきたいのが、モデル階層の中でのポジションです。公式は Opus 5 を「毎日使うために設計されたモデル(designed to be used every day)」と表現しています。他のモデルより効率よく動く、という点を前面に出しているんですね。

提供面での位置づけも明確に示されています。

  • Claude Max の新しいデフォルトモデル
  • Claude Pro で選べる最も強力なモデル

Fable 5 が「ここぞという場面の切り札」だとすれば、Opus 5 は「毎日の相棒」として置かれている、という整理になりそうです。コーディングと知識労働の評価(Frontier-Bench や GDPval-AA)では新たな最先端に立った一方、サイバーセキュリティのタスクでは依然として Mythos 5 の後ろにいる、と正直に書かれている点も好感が持てます。

ベンチマークで見る性能

今回のアナウンスで特徴的なのは、単純なスコアの高さではなく「コストあたりの性能」で語っている点です。公式のグラフは、モデルの effort 設定(推論にどれだけ手間をかけるかの設定)ごとに性能がどう変わるかを示す形になっています。知性を優先するか、トークンを節約して速く安く済ませるかを、利用者側で選べるという前提での比較です。

なお、ここから紹介する数字はいずれも Anthropic 自身が公表した評価結果です。たとえば Frontier-Bench v0.1 は社内での実行で、1タスクにつき5回試行した平均値、安全性の分類器が反応した場合は Opus 4.8 にフォールバックする、という条件が脚注に記されています。第三者による独立検証ではない点は踏まえたうえで読むのが良さそうです。

主な結果を挙げると、次のとおりです。

ソフトウェアエンジニアリング

  • Frontier-Bench v0.1 - 他のすべてのモデルを上回り、タスクあたりのコストはより低いまま、Opus 4.8 の性能を2倍以上に
  • CursorBench 3.2 - max effort で Fable 5 のピークスコアとの差が0.5%以内、しかもタスクあたりのコストは半分。high・xhigh・max の各 effort で、同じコストなら他のどのモデルより高い性能
  • AA Coding Agent Index - グラフのみ公開されていて、本文での数値の説明はありません
Frontier-Bench v0.1 における effort レベル別のスコアとコスト (出典:Introducing Claude Opus 5 \ Anthropic

横軸が1回あたりのコスト、縦軸がスコアです。グラフから読み取ると、Opus 5(オレンジ)は最大でおよそ44%に届いていて、Opus 4.8(青)のおよそ19%を大きく引き離しています。Fable 5(黄)やGPT-5.6 Sol(グレー)の到達点も上回っているのが分かります。

Frontier-Bench で「Opus 4.8 の2倍以上」というのは、世代交代としてはかなり大きな伸び幅です。Opus 4.8 が出たのが5月末ですから、2ヶ月足らずでこの差というのは驚きます。

問題解決・知識労働

  • ARC-AGI 3(未知の問題を解く力を測る評価) - スコアが次点のモデル(GPT-5.6 Sol)の3倍
  • Zapier AutomationBench(ビジネスタスクを最初から最後までやり切れるかを測る評価) - 同じコストで次点のモデルの約1.5倍の合格率。しかも最も低い effort 設定でさえ、他のどのモデルより多くのタスクを通過
  • OSWorld 2.0(コンピュータ操作のベンチマーク) - どのコスト水準でも他のすべてのモデルを上回り、Fable 5 の最高記録をその3分の1強のコストで超えた
ARC-AGI-3 のコスト別スコア。Opus 5 が約30%、GPT-5.6 Sol が約8% (出典:Introducing Claude Opus 5 \ Anthropic

ARC-AGI 3 のグラフは、差がはっきり出ていて分かりやすいと思います。Opus 5 がおよそ30%の高さにぽつんと置かれているのに対し、次点の GPT-5.6 Sol はおよそ8%、Opus 4.8 に至っては数%の水準です。

このほか GDPval-AA v2、HLE(Humanity's Last Exam)、DeepSearchQA でも、同社のモデルの中で最も高性能かつコスト効率が良い(our best and most cost-efficient model)と説明されています。他社モデルを含めた比較ではない点に注意してください。

AutomationBench の effort 別合格率。Opus 5 の最低値が他モデルの最高値を上回っている (出典:Introducing Claude Opus 5 \ Anthropic

このグラフは「最低の effort でも他を上回る」という話が一目で分かります。オレンジの Opus 5 だけが上のほうに固まっていて、いちばん低い点でも、他の3モデルのいちばん高い点より上にあります。

なお、AutomationBench の「次点のモデル」がどれを指すかは公式に明記がありません。グラフで Opus 5 と並べられているのは GPT-5.6 Sol・Fable 5・Opus 4.8 の3つで、どのコスト水準で比べるかによって次点にあたるモデルは変わります。

ARC-AGI 3 の「GPT-5.6 Sol の3倍」という数字は目を引きますが、僕が実務的に注目したいのは AutomationBench の方です。「最低の effort 設定でも、他のどのモデルより多くのタスクを通過した」というのは、普段づかいのモデルとしての底の高さを示す話だからです。

科学研究

生命科学系の評価では、Opus 4.8 をすべての項目で上回ったと報告されています。特に伸びが大きいのは次の2つです。

  • 有機化学 - 分光データから分子構造を推定するタスクなどで、社内ベンチマークで Opus 4.8 より 10.2パーセントポイント高い
  • タンパク質関連 - 配列の変異が機能にどう影響するかを予測するタスクで、7.7パーセントポイント高い

構造生物学やバイオインフォマティクスも含め、全体的に底上げされているとのことです。

ビジュアル出力

視覚的なアウトプットも大きく強化されたと説明されています。公式はデモとして、空気の流れを可視化した風洞(wind tunnel)のインタラクティブなシミュレーションと、細胞の構造を探索できる簡易的なイラストの2つを公開しています。どちらもブラウザ上で動かせる形になっているので、インタラクティブな制作物の質がどこまで来たかを確かめたい方は触ってみると分かりやすいと思います。

「自分で確かめる」力が伸びた

今回の発表を読んで、僕がいちばん面白いと感じたのがこの部分です。公式は、Opus 5 が「自分の作業を検証し、成功するまで丁寧に反復することが格段に得意になった」と説明しています。

紹介されている実例が具体的で、どれも印象に残るものでした。

1. 見えない図面から3Dモデルを起こした話

Frontier-Bench のあるタスクで、機械部品の図面を渡され、それを FreeCAD の3Dモデルとして再構築するコードを書くよう指示されました。ただしこのタスクでは、モデルが図面を直接見る手段が意図的に与えられていません。Opus 5 はこれに対して、自前でコンピュータビジョンのパイプラインを書き、生のピクセルから形状情報を取り出して、部品全体を再構築したとのことです。しかも一度きりの偶然ではなく、繰り返し成功したと報告されています。同じ条件で、競合モデルは5回試しても解けなかったそうです。

2. パッチが取りこぼした根本原因を見つけた話

広く使われているオープンソースのパッケージマネージャーの実際のバグを渡したところ、Opus 5 は根本原因を突き止め、コミュニティのパッチが見落としていたエッジケースまで修正したとのことです。一方、比較対象のモデルは表面的な症状だけを直して「バグは解決しました」と報告した、と書かれています。

3. 検証手段がないなら自分で作った話

ある取引会社のエンジニアが、新しい取引所向けのマーケットデータフィードを Opus 5 に構築させたところ、1セッションで完成させたそうです。従来のモデルは、エンジニアが詳細な計画を渡しても完了できなかったタスクです。しかも、検証に使えるライブのフィードが見つからないと分かると、Opus 5 は自分でテストハーネスを作って、取引所のデータを正しくパースできているかを確認したとのことです。

この3つに共通しているのは、「与えられた道具が足りないと分かったときに、自分で道具を作る」という振る舞いです。いずれも公式が挙げた事例で、どんなタスクでも同じように再現するとまでは示されていませんが、方向性としては分かりやすいと思います。Opus 4.8 のときに強調されていたのが「長く自走できること」と「自分の進捗に正直であること」でしたが、今回はそこから一歩進んで「詰まったときに自分で手段を用意する」方向に伸びている印象を受けます。

早期アクセス企業からの評価

公式には、早期アクセスで試した各社のコメントが多数掲載されています。要旨だけ紹介すると、おおむね次のような内容です。

  • Devin(Cognition)の CEO は、FrontierCode 1.1 で Fable 5 に迫る性能を半分のコストで発揮し、難しいデバッグや根本原因の分析で特に強いと評価しているそうです
  • Cursor の共同創業者は、Fable 5 に近い知性を Opus の速度とコストで実現していると述べているとのことです
  • Zapier の CEO は、従来の Claude より多くのトークンを使うことなく自社の AutomationBench で首位に立ち、これまでのモデルが通過できなかった一連の業務フローを100%こなしたと報告しています
  • Lovable の共同創業者は、最も難しいエージェント的コーディングのタスクで Opus 4.7 比22%向上し、実行ごとのブレ(variance)が大幅に小さいと評価しています
  • JetBrains の担当者は、Claude のモデル間の移行として、これまでで最も明確な問題解決能力の飛躍だと述べているそうです
  • Box の CTO は、Opus 4.8 比で全体8%、データ分析で11%、デューデリジェンス業務で17%の改善を確認したと報告しています

このほか、法務エージェントの領域で Opus 4.8 の最大推論時と同程度の性能を保ちながら平均トークンが26%少なくて済んだ、金融モデリングで正答率が平均9パーセントポイント向上しつつターン数とツール呼び出しが3分の1減り所要時間が60%短縮された、取引ベンチマークで Opus 4.8 の約7分の1の推論トークンと半分未満のレイテンシで済んだ、といった報告も並んでいます。いずれも各社それぞれの評価環境での報告で、条件をそろえた横並びの比較ではありません。

数字の並びを眺めていて気づくのは、「性能が上がった」だけでなく「同じ結果をより少ないトークン・より短い時間で出せるようになった」という報告が多いことです。日々 Claude Code を使っていると、Rate Limit やコストは現実的な制約として効いてきますから、この方向の改善は素直にありがたいところです。

アライメントと安全性

性能の話と同じくらいの分量で、アライメント(AI の振る舞いを人間の意図や価値観に一致させること)についても説明されています。

公式によると、デプロイ前の自動化された行動監査(automated behavioral audit)で、Opus 5 は これまでで最もアライメントが取れたモデル だと評価されました。具体的には次のような点が挙げられています。

  • Claude's Constitution(Claude の憲法)への準拠が、Opus 4.8・Sonnet 5・Fable 5 のいずれよりも良い
  • 人をあざむく振る舞い(deceptive behavior)の発生率が最も低い
  • 悪用に誘導されにくさが最も高い
  • 取り返しのつかない副作用を招くような無謀な行動を避けるという点でも、これまでで最も安全

行動監査における misaligned behavior の総合スコアは 2.3 で、直近のモデルの中で最も低い数値だそうです。

自動行動監査における misaligned behavior スコア。Opus 5 が 2.30 で最も低い (出典:Introducing Claude Opus 5 \ Anthropic

このスコアは低いほど良い指標です。Opus 4.8 が2.85、Mythos 5 が2.81、Sonnet 5 が3.35 と並ぶなかで、Opus 5 だけが2.30 と一段低くなっています。なお本文では Opus 4.8・Sonnet 5・Fable 5 との比較に触れていますが、このグラフに並んでいるのは Opus 4.8・Mythos 5・Sonnet 5 の3つです。

Opus 4.8 の記事で「誠実さ」の改善に注目したことを書きましたが、その路線がさらに一段進んだ形です。長く任せられて、進捗に正直で、無謀な手は打たない。仕事の相棒として信頼を寄せるうえで、この3つが揃っている意味は小さくないと思います。

サイバーセキュリティの扱い

安全性については、正直な限界の開示もされています。Opus 5 は危険な二重用途(dual-use)の能力で最先端を押し上げてはおらず、生物学研究と攻撃的なサイバーセキュリティのいずれも Mythos 5 の後ろにとどまる、という説明です。

興味深いのは、Anthropic が 意図的にサイバータスクの訓練を避けている と明言している点です。それでも全般的な能力向上の副産物として、脆弱性を「見つける」能力は Mythos 5 に迫る水準まで来たとのことです。ただし、見つけた脆弱性を実際の脅威に変える「エクスプロイト開発」については、依然として Mythos 5 に大きく水をあけられている、と説明されています。

これは OSS-Fuzz という評価に表れていて、脆弱性の特定では Mythos 5 と同程度の成功率なのに対し、エクスプロイトの開発ではスコアが大きく離れている、という結果が示されています。専用の訓練を避けていても、一般的な能力の向上に引きずられて脆弱性発見の力は伸びてしまう。その事実を隠さずに開示しているところに、この会社の姿勢が出ていると思います。

Opus 5 の safeguards

安全装置(safeguards)は、基本的に Opus 4.8 と似た構成で、一部のサイバータスクにだけ強めのガードレールが追加されています。

サイバーセキュリティについては、分類器(classifier)が Fable 5 のものより緩く設定されています。ソースコードから脆弱性を見つけることは許可し、悪意ある利用と結びつきやすい「バイナリベースの脆弱性スキャン」、ペネトレーションテスト(実際に攻撃を仕掛けてみて侵入できるかを確かめる検査)、エクスプロイト生成(見つけた脆弱性を実際に突くための攻撃コードを作ること)はブロックする、という切り分けです。テストの結果、分類器が介入する頻度は Fable 5 の場合と比べて 約85%少なくなる と見込まれているそうです。

Claude.ai・Claude Code・Claude Cowork では、フラグが立ったリクエストは既定で Opus 4.8 にフォールバックします。API でもこのフォールバックを有効化できます。また、正規のセキュリティ業務が safeguards に阻まれないよう、Cyber Verification Program(CVP)というプログラムが用意されていて、参加済みの企業や研究者は制限の緩いバージョンの Opus 5 にすぐアクセスできるとのことです。

生物学については、Opus 4.8 と同様の safeguards なので、Opus 5 は「同社が一般提供しているモデルの中で、科学研究の能力が最も高いモデル」になった、と説明されています。ただし、長時間にわたる自律的な研究タスクには重要な制約が残っていて、この領域では引き続き Mythos 5 の方が強いとのことです。今回の公開に合わせて、Fable 5 でブロックされる生物学関連のリクエストは、Opus 4.8 ではなく Opus 5 にルーティングされるようになりました。

料金と提供状況

料金は次のとおりです。

利用形態入力(per 1M tokens)出力(per 1M tokens)
通常(Opus 4.8 から据え置き)$5$25
Fast mode$10$50

Fast mode は、Opus 5 を 約2.5倍の速度 で動かす構成で、価格は基本料金の2倍です。Claude Platform では通常の課金で、Claude Code では usage credits を通じて利用できます。このあたりの考え方は Opus 4.8 のときと同じですね。

API のモデル ID は claude-opus-5 です。Claude.ai、Claude Code、Claude Cowork、API と、すべてのプラットフォームで公開初日から利用できます。

データの扱いについても、これまでの Opus モデルと同様に、一般提供の利用ではデータ保持要件(data retention requirements)がないと明記されています。

同時に公開された2つのベータ機能

Opus 5 と合わせて、開発者向けに2つのアップデートがベータ提供されています。

1. 会話の途中でツールを変更できる(Claude Platform)

これまでは、会話の途中で Claude が使えるツールの構成を変えると、prompt cache(プロンプトキャッシュ)が無効になってしまいました。今回のアップデートで、キャッシュを無効化せずにツールを差し替えられる ようになります。

補足しておくと、prompt cache は同じプロンプトの前半部分を再利用してコストとレイテンシを下げる仕組みです。エージェント的なアプリケーションでは、作業の段階に応じて渡すツールを絞りたい場面がよくありますが、そのたびにキャッシュが飛んでいたわけです。地味な変更に見えて、ツールを多く扱うアプリケーションではコスト面で効いてくる改善だと思います。

2. API での自動フォールバック

Opus 5(および Fable 5)で安全性の分類器にフラグを立てられたリクエストを、自動的に別のモデルへルーティングする設定が選べるようになりました。この設定を有効にすると、API のリクエストはブロックされる代わりに、常にその時点で利用可能な最良のモデルへ回されます。

本番のアプリケーションで「ブロックされて処理が止まる」というのは扱いに困る挙動ですから、フォールバック先を用意できるのは実装上ありがたい選択肢です。

Opus 4.8・Fable 5 との比較

主な違いを表にまとめておきます。

項目Opus 4.8Opus 5Fable 5
クラスOpus classOpus classMythos-class
料金(入力/出力・per 1M tokens)$5 / $25$5 / $25(据え置き)$10 / $50
Fast mode2.5倍速・基本料金の2倍2.5倍速・基本料金の2倍-
コーディングSWE-Bench Pro 69.2%Frontier-Bench v0.1 で Opus 4.8 の2倍以上ほぼ全ベンチマークで最先端
CursorBench 3.2-max effort で Fable 5 との差 0.5%以内(コストは半分)ピークスコア
アライメントMythos Preview と同水準これまでで最もアライメントが取れたモデル(misalignment 2.3)-
サイバー分類器-Fable 5 比で介入が約85%減より厳しい
Claude のプラン-Max の新デフォルト / Pro の最上位-

Opus 4.8 と Fable 5 の欄は、今回のアナウンスではなく過去記事で取り上げた発表内容にもとづいています。

こうして並べると、Opus 5 の狙いがはっきりします。Fable 5 の「性能の天井」に近づきつつ、価格と速度は Opus の水準に据え置く。つまり「特別な日のモデル」ではなく「毎日のモデル」を一段引き上げに来た、という発表だと読めます。

ユーザーにとって、どこが嬉しいのか

ここまでの内容を、「自分の仕事にどう効くか」という視点で整理し直してみます。

1. 値上げなしで、上のクラスに近い性能が使える

Opus 4.8 と同じ $5 / $25 のまま、Fable 5 に迫る性能が手に入ります。Fable 5 を使うたびにコストや Rate Limit を気にしていた身としては、この点がいちばん大きな変化です。

2. 同じ仕事を、より少ないトークンと時間で終えられる

早期アクセス各社の報告では、「精度が上がった」だけでなく「トークンが減った」「所要時間が短くなった」という数字が繰り返し出てきます。Claude Code のように長いセッションを回す使い方では、この効率改善がそのまま体感に直結します。

3. 詰まったときに自分で手段を用意してくれる

図面を直接見られないならコンピュータビジョンのパイプラインを書き、検証用のフィードがないならテストハーネスを作る。この振る舞いは、指示が完璧でなくても前に進んでくれる、ということを意味します。こちらの段取りの負担が減る方向の改善です。

4. 安心して任せられる度合いがさらに上がった

Constitution への準拠、あざむき行動の少なさ、無謀な行動の回避と、アライメントの各指標でこれまでで最良と評価されています。取り返しのつかない操作を避ける性質は、本番環境に近いところで作業させるほど効いてきます。とはいえこれは社内の自動監査での相対評価ですから、権限の制限や承認フローといった運用側の備えを外してよい、という話ではありません。

5. 科学研究の用途で選択肢が広がった

生物学の safeguards が Opus 4.8 と同様であることから、Anthropic は Opus 5 を、同社が一般提供しているモデルの中で科学研究の能力が最も高いモデルだと説明しています。有機化学で10.2パーセントポイント、タンパク質関連で7.7パーセントポイントという伸びは、この領域で使っている方には見逃せない数字だと思います。

Claude Code で試してみる

Opus 5 が利用可能な環境であれば、最新版の Claude Code の /model コマンドから選択できます。Claude Max を使っている場合は、すでにデフォルトが Opus 5 に切り替わっているはずです。手元でまだ見えない場合は、アップデートしてから再起動してみてください。

claude update

Fast mode を試したいときは、Claude Code 上で /fast を実行すると切り替えられます。公式の説明では、Claude Code での Fast mode は usage credits を通じての提供です。

なお、表示の可否やデフォルトの挙動は、プラン・provider・管理者設定によって異なります。まだ Homebrew や npm 経由で Claude Code を使っている方は、このタイミングでネイティブインストールに切り替えておくと、自動更新が効いて新機能への追従がスムーズになります。詳しい手順は Claude Code を Homebrew からネイティブインストールに切り替えたら快適になった話 にまとめてあります。

また、Anthropic は Opus 5 向けの prompting guide を公開しています。モデルの性格が変わると、効く書き方も変わります。Opus 4.8 のときも同様のガイドが出ていましたが、実際に読んで手元のプロンプトを見直すと、素の性能を引き出しやすくなります。

まとめ

Claude Opus 5 のポイントをまとめると、こんな感じになります。

  • Fable 5 の最先端の知性に、半額($5 / $25) で迫るモデル。料金は Opus 4.8 から据え置き
  • Claude Max の新しいデフォルト、Claude Pro で選べる最強のモデル
  • Frontier-Bench v0.1 で Opus 4.8 の2倍以上、CursorBench 3.2 では max effort で Fable 5 との差が0.5%以内
  • ARC-AGI 3 で次点の3倍、AutomationBench で約1.5倍の合格率、OSWorld 2.0 では Fable 5 の最高記録を3分の1強のコストで突破
  • 有機化学で10.2パーセントポイント、タンパク質関連で7.7パーセントポイントと、科学研究の領域でも底上げ
  • 図面が見えなければ自前でコンピュータビジョンを書き、検証手段がなければテストハーネスを作る、という「自分で確かめる」力
  • 行動監査で misaligned behavior 2.3。これまでで最もアライメントが取れたモデルという評価
  • サイバー分類器の介入は Fable 5 比で約85%減。Fable 5 でブロックされる生物学のリクエストは Opus 5 にルーティング
  • Fast mode は2.5倍速・基本料金の2倍。API のモデル ID は claude-opus-5
  • ベータで、会話途中のツール変更(キャッシュを無効化しない)と、API の自動フォールバックを追加

Fable 5 が出てからまだ1ヶ月半ほどですが、今回は「上のクラスを開放する」のではなく、「毎日使うモデルを上のクラスに近づける」というアプローチでした。派手さでいえば先月の発表の方が上かもしれませんが、実務への効き方でいうと、こちらの方が大きいかもしれません。値段が変わらないというのが、何よりありがたいところです。

僕もさっそく Claude Code のモデルを切り替えて、しばらく使い込んでみるつもりです。使ってみて気づいたことがあれば、また記事にまとめたいと思います。

参考リンク

この記事をシェア

関連記事