
記事の理解を助けるための画像
コーディング向け「Sol」、事務作業向け「Luna」
OpenAIは2026年9月22日(現地時間)、新たなAIモデル「GPT-6 Sol」と「GPT-6 Luna」を公開した。上位モデルのGPT-6 Astraと似た訓練手法を採用し、専門業務や事実性、コーディング、パソコン操作、安全性に関する改善を、より高速で低価格なモデルに取り込んだとしている。
Solは複雑なコーディング作業に重点を置く。一方、Lunaは文書作成などのオフィス業務、要約、情報抽出を主な用途に据えた。
API料金を大幅に引き下げ
GPT-6 SolのAPI料金は、入力100万トークン当たり2ドル、出力100万トークン当たり10ドル。OpenAIによると、GPT-5.6の販促価格と比べて50%安い。GPT-6 Lunaは入力が100万トークン当たり0.20ドルから0.10ドル、出力が1.20ドルから0.50ドルに下がった。
APIのモデルIDはそれぞれ「gpt-6-sol」と「gpt-6-luna」で、発表当日から利用できる。両モデルはChatGPTのPlus、Pro、Business、Enterprise、Edu契約者向けに、ChatGPT WorkとCodexでも提供される。FreeとGoの利用者はデスクトップアプリでLunaを使える。ただしMacRumorsは、発売時点では両モデルともChatモードで利用できないと報じている。
GitHubも、VS CodeやVisual Studio、Copilot CLI、クラウドエージェント、GitHub Mobile、JetBrains、Xcode、EclipseなどのGitHub Copilotへ順次展開する。SolはCopilot Pro+、Max、Business、Enterprise、LunaはPro以上の各プランが対象となる。
OpenAIは低コストと事実性の改善を強調
OpenAIの発表によると、GPT-6 Solは自動化能力を測るAutomationBenchで、最高水準の推論設定「xhigh effort」を使った場合、作業当たり0.27ドルの費用で33.2%を記録した。Agents' Last Examでは「max effort」で56.4%、ソフトウェア開発能力を測るDeepSWE v1.1では68.8%だった。LunaのDeepSWE v1.1は66.6%だった。
パソコン操作を評価するOSWorld 2.0 offlineでは、xhigh effortのSolが60.5%、medium effortのClaude Opus 5が60.3%だった。OpenAIは、SolがClaude Opus 5に近い成績を、作業当たり約80%低い費用で達成したと説明する。また、max設定のLunaは、費用を10分の1に抑えながらmedium設定のGPT-5.6 Solを上回れるとしている。
社内の事実性評価では、Solの誤りがGPT-5.6 Solの約半分になったという。もっとも、この評価は匿名化した実際の会話を使った社内試験で、第三者による検証結果は示されていない。OpenAI自身も、誤りを引き起こしやすい会話を選んだ評価であり、一般的な利用状況を代表するものではないと注意を促している。エージェントやコーディングの試験についても、意図的に難しい条件を設定しており、通常利用での失敗率を示すものではないとしている。
独立評価では改善と後退が混在
独立評価機関Artificial AnalysisのCoding Agent Indexでは、max設定のSolが57点となり、GPT-5.6 Solの55点を上回った。一方、Lunaは旧モデルの43点から41点へ低下した。
知識の正確性などを測るAA-Omniscience Indexは、Solが22点から27点、Lunaがマイナス10点から1点に改善した。同評価で測った幻覚率も、Solは92%から60%、Lunaは93%から77%へ低下した。Terminal-Bench 4.0とAutomationBench-AAでも、両モデルは旧世代を上回った。
反対に、経済的価値のある業務を評価するGDPval-AA v2.1では、Solが約100 Elo、Lunaが約75 Elo下落した。AA-Briefcase v1.1でもLunaが約45 Elo下がり、Solは横ばいだった。Artificial Analysisは、基礎能力が落ちたのではなく、表現の質が低下したことや、評価基準で求められる要素が回答から抜けたことが原因だと分析している。
同機関の集計では、max設定の作業当たり費用はSolが1.06ドルとおおむね半減し、Lunaは0.07ドルと約60%下がった。ただ、総合的なIntelligence IndexはSolが1点上昇しただけで、Lunaは変わらなかった。価格面の改善が目立つ半面、能力向上は評価項目によってばらつきがある。
Anthropicも約90分前に対抗モデル
競争相手のAnthropicは、OpenAIの発表より約90分早く「Claude Opus 5.5」を公開した。MacRumorsによると、同モデルは一部のコーディングや知識業務で、OpenAIの上位モデルGPT-6 Astraを上回る性能を示したという。競合モデルの世代交代が重なったことで、作業当たりの費用を単純に比較することは難しくなっている。
OpenAIが示したDeepSWE v1.1の結果でも、Claude Fable 5の最高値69.9%がGPT-6 Solの68.8%を上回った。今回の新モデルは、API料金と作業コストを抑えながら一部のコーディング指標を伸ばした一方、Lunaのコーディング評価や両モデルの業務評価では後退も確認された。利用企業にとっては、価格だけでなく、実際の用途に合った性能を見極める必要がありそうだ。
コメント
コメントを投稿