
記事の理解を助けるための画像
Opus 5より実行コストを40%削減
米AI企業アンソロピックは9月22日(韓国時間23日)、生成AIの新モデル「Claude Opus 5.5」を公開した。5.5シリーズの第1弾で、多くの作業において「Claude Fable 5.1」と同水準の性能を維持しながら、実行コストを従来のOpus 5より40%引き下げたとしている。
出力の生成速度もOpus 5に比べて30%以上向上したという。API料金は100万トークン当たり入力4ドル、出力20ドル。Opus 5の入力5ドル、出力25ドルを下回る。
アンソロピックのClaudeプラットフォームに加え、アマゾン・ウェブ・サービス(AWS)、グーグル・クラウド、マイクロソフト・アジュールで提供する。APIのモデルIDは「claude-opus-5-5」。
コーディング性能、評価項目で優劣分かれる
アンソロピックが公表したコーディング評価「FrontierCode v1.1」では、Opus 5.5が54.4%となり、OpenAIの「GPT-6 Astra」の53.3%をわずかに上回った。同社によると、標準の「medium」設定でAstraの最高スコアを超え、作業当たりの費用は約5分の1だった。
「Terminal-Bench 4.0」については、Astraと同等の性能を約40%の費用で実現したと説明している。同社資料に記載された最高努力設定のスコアはOpus 5.5が66.4%、Astraが57.9%だった。
一方、科学分野の「Terminal-Bench-Science 0.1」ではAstraが64.6%、Opus 5.5が58.7%となった。「AutomationBench」でもAstraが41.4%、Opus 5.5が40.0%で、Astraが上回った。「CursorBench 4.0」ではOpus 5.5が57.8%、GPT-5.6 Solが41.7%だったが、Astraの結果は示されていない。
これらは各社が発表した数値で、独立した再現検証は行われていない。独立評価機関Vals AIによる直接比較では、両モデルはほぼ互角で、Astraがわずかに先行する結果だった。Digital Appliedは、5ポイント未満の差については実際に試すまで優劣を判断できないと指摘。価格と共通するベンチマークの多くではOpus 5.5、自動化と科学分野ではAstraが優勢だと評価した。
安全性向上を強調、評価手法の限界も認める
アンソロピックは、自社の自動行動監査でOpus 5.5が過去最高の評価を得たとしている。許容範囲を逸脱しようとする試みはOpus 5に比べて約85%減少し、外部から不正な指示を埋め込む「プロンプトインジェクション」の成功率もFable 5.1と並んで最も低かったという。サイバーセキュリティーや生物学に関する作業には、別のモデルへ処理を引き継ぐ安全策を導入した。
ただし同社は、導入前にあらゆる不具合を確実に検出できる評価手法の構築は、なお未解決の課題だと認めた。また、Opus 5.5が自らを評価する試験環境に置かれていると疑っているような兆候が、頻繁に確認されたとしている。
AI開発の速度調整を訴えた直後に投入
今回の発表は、ダリオ・アモデイ最高経営責任者(CEO)がAIの能力向上のペースを調整する必要性を表明してから初めての新モデル投入となる。アモデイ氏はその狙いについて、リスク対策が進歩に追いつく時間を確保するためだと説明している。
OpenAIは9月3日にGPT-6 Astraを限定公開し、アンソロピックも9月上旬に「Claude Fable 5.1」と「Claude Mythos 5.1」を発表していた。AI各社の競争が続くなか、Opus 5.5は性能だけでなく、利用コストと安全性を前面に打ち出したモデルとなる。
コメント
コメントを投稿