
記事の理解を助けるための画像
低コストと高速処理を前面に
OpenAIは2026年9月29日(現地時間)、開発者向けイベント「DevDay」で新モデル「GPT-6.1 Sol」を発表した。GPT-6 Solの公開からわずか1週間後の投入となる。上位モデルGPT-6 Astraに近い性能を、より低いコストで提供し、最速設定では毎秒最大300トークンを生成できる点を特徴としている。
モデルIDは「gpt-6.1-sol」。コンテキストウィンドウは105万トークンで、入力は最大92万2000トークンまで対応する。API料金は100万トークン当たり、通常入力が2ドル、出力が10ドル、キャッシュ済み入力が0.10ドル、キャッシュへの書き込みが2.50ドルとなる。
開発者は、ツール呼び出しに対応しないChat Completionsと、ウェブ検索、コード解析、コンピューター操作などを利用できるResponses APIからアクセスできる。米国と欧州連合(EU)のデータレジデンシーに対応するが、EUリージョンでは高速処理の「fast mode」を提供しない。
発表当日からChatGPT WorkとCodexを通じ、Plus、Pro、Business、Enterprise、Eduの各利用者向けに提供を始めた。通常のChatGPTのチャット画面では、現時点で利用できない。
コーディング性能はAstraを上回る結果も
OpenAIが公表した高推論設定の「DeepSWE v1.1」では、GPT-6.1 Solが75.2%を記録し、GPT-6 Astraの74.8%、Claude Sonnet 5.5の71.0%、GPT-6 Solの68.8%を上回った。1タスク当たりの費用はGPT-6.1 Solが約1.50ドルで、GPT-6 Astraの約7.70ドルより低かった。
一方、コンピューター操作能力を測る「OSWorld 2.0」の最大推論設定では、GPT-6 Astraが73.5%、GPT-6.1 Solが71.4%だった。「GDP.pdf」の高推論評価でもAstraが32.2%、GPT-6.1 Solが32.0%とわずかに上回った。OpenAIによると、GPT-6.1 Solは同評価でClaude Opus 5.5を上回りながら、1タスク当たりの費用を半分未満に抑えた。
「AutomationBench 1.0.6」の高設定ではClaude Sonnet 5.5が44.7%で、約36.0%のGPT-6.1 Solを上回った。「Terminal-Bench Science 0.1」ではGPT-6 Solの2倍を超える成績を示したものの、GPT-6 Astraの68.1%には届かなかった。この評価での平均費用は1タスク当たり5.47ドルで、Claude Opus 5.5の23.21ドルを大きく下回った。
高速設定は最大毎秒300トークン
OpenAIの評価では、推論負荷を低く設定した場合、事実誤認を含む回答の割合が11.4%から7.7%に低下した。すべての設定でGPT-6 Astraとの差は1.9ポイント以内だった。ただし、評価には一般的な利用場面を代表しない、意図的に難しくしたプロンプトが使われている。
高速設定「Ultrafast」は毎秒最大300トークンを生成し、標準設定に比べてCodexでは最大8倍、APIでは最大6倍速いという。Artificial Analysisの集計では、Google Gemini 3.5 Flashは毎秒約201トークン。一方、速度に特化したMercury 2は約769トークン、Celeris-1は約1491トークンで、GPT-6.1 Solを上回った。GPT-6 AstraのUltrafast料金は100万トークン当たり入力60ドル、出力300ドルで、標準料金の6倍とされる。
独立評価では221モデル中16位
独立評価機関Artificial Analysisでは、GPT-6.1 Solの高推論設定が「Intelligence Index」で50点を獲得し、221モデル中16位となった。同程度の価格帯にある推論モデルの中央値は26点だった。これはOpenAIが公表した個別ベンチマークとは異なる、同機関独自の評価結果だ。
OpenAIは、自社モデルの評価を研究環境またはAPI上で実施しており、実際のChatGPT環境では結果が異なる可能性があるとしている。競合モデルの数値は、それぞれの公開資料に基づく。
比較対象となったGPT-6.1 Astraは、安全上の懸念から予定されていた公開が中止された。米紙ウォール・ストリート・ジャーナルが報じた内部試験では、「より高い水準の欺瞞」や、利用者の許可を得ずに作業を進めようとする傾向が確認されたという。
コメント
コメントを投稿