Anthropic、「Claude Sonnet 5.5」を発表 低コストと処理性能の両立を強調

Anthropic、「Claude Sonnet 5.5」を発表 低コストと処理性能の両立を強調

記事の理解を助けるための画像

米AI企業Anthropicは2026年9月28日(現地時間)、生成AIの新モデル「Claude Sonnet 5.5」を発表した。モデルIDは「claude-sonnet-5-5」。従来のSonnetシリーズを上回るベンチマーク性能に加え、処理速度とコスト効率の改善を売りにする。

入力100万トークン2ドル、主要クラウドでも提供

Claude Sonnet 5.5はClaude Platformのほか、AWS、Google Cloud、Microsoft Azureを通じて利用できる。入力データを保存しない構成にも対応する。

API料金は入力100万トークン当たり2ドル、出力100万トークン当たり10ドル。キャッシュ読み込みは同0.20ドル、書き込みは2.50ドルに設定された。VentureBeatによると、料金はGPT-6 Solと同水準で、入力4ドル、出力20ドルのClaude Opus 5.5を下回る。

Anthropicは、推論時の計算量を抑えた「低」または「中」の努力設定でも、Sonnet 5の最高スコアを上回り、タスク当たりの費用をおよそ10分の1にできるとしている。SiliconANGLEは、前世代より出力速度が30%向上し、必要なトークン数も減ったことで、実質的な費用が約30%下がったと報じた。

一部指標で上位モデルに迫る

Anthropicが公表した評価では、端末操作能力を測るTerminal-Bench 4.0で70.6%を記録した。Sonnet 5の10.3%、上位モデルOpus 5.5の66.4%を上回った。

一方、コーディング能力を測るFrontierCode 1.1 Mainでは、最大努力設定で46.2%だった。Sonnet 5の42.4%を超えたものの、Opus 5.5の54.4%とGPT-6 Solの49.3%には届かなかった。

GDPval-AA v2.1では1844点で、Opus 5.5の1846点とほぼ同水準。GPT-6 Solは1487点、Sonnet 5は1449点だった。Humanity's Last Examでは64.5%、OSWorld 2.1では80.1%を記録し、いずれもSonnet 5を上回ったが、Opus 5.5には及ばなかった。

Anthropicの比較表でも、Opus 5.5はFrontierCodeやCursorBenchなど複数の評価でSonnet 5.5より高いスコアを示した。同社は、継続的な判断が必要な複雑で自由度の高い作業では、Opus 5.5が依然として明確に強いとしている。

独立評価では総合上位、長い出力に課題

独立評価機関Artificial Analysisは、Sonnet 5.5のIntelligence Indexを56点と評価した。対象216モデルのうち3位で、中央値の26点を大きく上回った。

同機関が測定したタスク当たりの費用は7.60ドル。評価中の総出力は4億1000万トークンに達し、中央値の8800万トークンを大幅に上回ったことから、「非常に冗長」と評された。出力速度は毎秒141.9トークンで28位だったが、最初のトークンが出るまでには353.32秒を要した。

Vals AIの評価では、Vals Indexが69.22%±0.96となり、66モデル中2位だった。首位のOpus 5.5とは0.47ポイント差にとどまる。一方、テスト1回当たりの費用はSonnet 5.5が20.80ドルで、Opus 5.5の32.77ドルより低かった。

ただし分野別ではばらつきもみられた。CyberBenchは59.58%で41モデル中31位、Harvey's Legal Agent Benchmarkは2.92%で70モデル中36位にとどまった。

業務現場では処理時間の短縮を報告

VentureBeatが紹介したクラウド企業Boxのヤショーダ・バブナニ副社長によると、Sonnet 5.5は従来より2.4倍速く、使用した総トークン数も12%少なかったという。SiliconANGLEが引用したZendeskのAI担当幹部も、問い合わせチケットの処理が20%速くなったと説明した。

またSiliconANGLEは、画面のスクリーンショットだけを手掛かりにゲーム「ポケットモンスター 赤」をクリアした初のSonnetモデルだと報じている。

生物学分野では誤検知の可能性

Anthropicは安全対策について、一部の微生物学やウイルス学に関する依頼を誤って遮断する場合があると説明した。サイバーセキュリティー、生物学、機微な内容では安全機能が作動する可能性がある一方、SiliconANGLEによると、一般的なソフトウェア開発や生命科学の作業の多くは影響を受けないとしている。

Source: Original Korean article - Trendy News Korea

コメント