仏Mistral AI、1兆パラメーターの「Mistral Large 4」公開 性能評価にはばらつきも

仏Mistral AI、1兆パラメーターの「Mistral Large 4」公開 性能評価にはばらつきも

記事の理解を助けるための画像

まずはAPIで提供、重みは10月27日公開へ

フランスの人工知能(AI)企業Mistral AIは2026年10月6日、最新の大規模モデル「Mistral Large 4」を発表した。愛称は「le Chonk」。総パラメーター数は1兆で、処理に応じて専門部分を使い分ける「専門家混合(MoE)」方式を採用し、一度に490億パラメーターを稼働させる。コーディングエージェントや知識業務、サイバーセキュリティー、画像内の位置関係を理解する視覚推論などを主な用途に掲げる。

モデルIDは「mistral-large-4-0」。現在はMistral StudioのプレビューAPIと、安全対策を施したエンドポイントを通じて利用できる。料金は100万トークン当たり入力が1.36ドル、出力が4.18ドルだ。

学習済みの重みは発表時点では配布されておらず、約3週間の試験期間を経て10月27日に公開する予定。Mistral AIは、信頼できるパートナーや政府と協力して安全性を検証し、防御目的には活用できても悪意ある攻撃には使われにくい状態を整えてから公開すると説明している。独自のMistralライセンスが適用される。

学習には米NvidiaのGrace Blackwell GPUを4000基使用し、期間は約2カ月。160を超える言語に対応するほか、テキストと画像などを扱うマルチモーダル入力を受け付け、出力はテキストに限られる。Mistral AIは9月の資金調達で、企業価値210億ユーロの評価を受け、30億ユーロを調達している。

コーディングでは競合を上回る指標も

Mistral AIが公表したコーディング関連の評価では、DeepSWE v1.1が61.7%となり、DeepSeek V4 Pro 0813を上回った。Terminal Bench 4.0は28.3%でQwen3.8 Maxより高く、SWE-Atlas-QnAは59.4%で同社が追跡する競合モデルを上回ったという。複数の評価をまとめたCoding Agent Indexも49.8%となり、DeepSeek V4 ProとQwen3.8 Maxを上回った。

一方、Surge AIによるコーディングのブラインド人手評価では、5点満点で3.74点にとどまり、Claude Opus 5の4.22点を下回った。別集計のDeepSWE v1.1ではMistral Large 4が62%、GLM-5.3が61%、DeepSeek V4 Pro 0813が57%、Qwen 3.8 Maxが51%だったが、公開された最適設定で評価したGPT-6 Astra、Gemini 3.8 Flash、Claude Opus 5はいずれも約74%だった。

業務自動化を測るAutomationBenchでは59.9%となり、Kimi K3、MiMo-V2.6-Pro、DeepSeek V4 Proを上回った。知識労働を評価するAA-BriefcaseのEloスコアは1393で、DeepSeek V4 Proより高かった。Harvey Legal Agentでは15%、Kimi K3は12.92%、GLM-5.3は8.33%。金融分野のFinch Financeでは、Mistral Large 4とDeepSeek V4 Pro 0813がともに67%だった。

セキュリティーや視覚推論にも重点

同社発表によると、Mistral Large 4はAA Cyber Indexで世界上位5モデルに入り、Cybenchでは93%を記録して主要なオープンウェイトモデルを上回った。B3 Security Benchmarkの攻撃耐性は93.3%、責任ある応答を測るKORA Benchmarkは2点満点で1.691点となり、GLM-5.2、GLM-5.3、Kimi系モデルより高かったとしている。

視覚的な位置推論を測るDense 200では42%で、GPT-6 Astraの41%を上回った。DIOR-RSVGは73%だった。科学コードを評価するSciCode-Verifiedについても、オープンウェイトモデルで最高水準だと説明している。

アルチュール・マンシュ最高経営責任者(CEO)は、サイバー分野を含む一部の側面で中国モデルを上回ったと述べた。ただし、具体的にどの中国モデルと、どのような条件で比較したかは明らかにしていない。

独立評価では総合32位、閉鎖型との差も

外部機関の評価を見ると、結果は一様ではない。Vals AIのVals Indexでは48.05%(誤差プラスマイナス1.11)で、44モデル中32位だった。個別ではHarvey Legal Agentが75モデル中6位、Finance Agent v2が75モデル中22位、Tax Agent Benchが66モデル中25位、EMBが71モデル中43位、Vibe Code Bench v1.1が109モデル中25位となった。

Artificial Analysis Intelligence Indexでは38.4点で、オープンウェイトモデルの8位。Xiaomi MiMo-V2.6-Proの46.3点、Z.ai GLM-5.3の44.8点、Moonshot AI Kimi K3の43.6点を下回る一方、DeepSeek V4 Proの36.0点、GLM-5.2の33.7点、韓国のMotif 3の33.6点を上回った。Motif 3は、それまで中国以外で最も高性能なモデルと位置付けられていた。

ただ、重みを公開しない閉鎖型モデルでは、Claude Opus 5.5が57.6点、GPT-6 Astraが52.7点、Gemini 4 Argonが52.6点と、Mistral Large 4を大きく上回った。Artificial Analysisが算出したMistral Large 4の1タスク当たりの費用は1.13ドル(1ユーロ)だった。

Mistral AIによると、プレビュー版の強化学習は現在も進行中で、性能向上が頭打ちになる兆候はまだ見られないという。科学担当副社長のピエール・ストック氏は、学習に使った計算量が閉鎖型の競合モデルより大幅に少なく、中国の競合モデルと比べても約2分の1から3分の1だったと説明した。もっとも、一部の評価結果や競合モデルの詳しいスコアは未公表であり、重みの公開後に再現性を含めた検証が進むことになる。

Source: Original Korean article - Trendy News Korea

コメント