AI活用

Gemini 4 Argonはいつ使える?|法務・金融の評価で他社を上回った数字の読み方と、待つ間にやること

「Gemini 4 Argon が、法務や金融の仕事で GPT-6 Astra や Claude を大きく上回ったらしい。うちの会社でも、すぐ使えるのだろうか」。

Google は米国時間9月30日(日本時間10月1日の早朝)、新しい最上位のモデル Gemini 4 Argon を発表しました。いまはサイバー攻撃を防ぐ側の、審査を通った組織だけに配っています。一般向けには、API(ほかのシステムから AI を呼び出す窓口)を有料で使う利用者と、Google AI Ultra の加入者から順に広げる予定ですが、時期は決まっていません。

中小企業がいま Argon を使う方法はありません。i-Style が10月1日の午後に Google の API で確かめても、選べるモデルの一覧に Argon は出てきませんでした。話題になった数字にも読み方があり、法務の19.6%は「採点基準を全部満たして解けた課題が5つに1つ」という意味です。

lightbulb

先にまとめ

一般公開の時期は決まっていません(10月1日に確認)。最初はサイバー防御の審査を通った組織だけで、次が有料の API 利用者と Google AI Ultra の加入者です。Ultra の2段階のどちらが対象か、Google Workspace の Gemini で使えるかは、発表に書かれていません。

法務・金融・業務の自動化では、Google の表の上で GPT-6 Astra と Claude を上回りました。ただし法務の順位表の全体では5位で、独立の評価会社の総合点では GPT-6 Astra と同点、Claude Opus 5.5 には届きません。正答率は高くないものの、分からないときに「分からない」と答えやすい性格です。

API の料金は、発売直後の導入価格なら入力100万トークン(トークンは AI が文章を数える単位)あたり2ドル・出力10ドルで、Opus 5.5 の半額です。導入価格が終わると Opus 5.5 と同じ4ドル・20ドルになり、終わる日は公表されていません。

いまはサイバー防御の審査を通った組織だけ。Ultra と有料 API が次だが、時期は未定

Google の発表によると、Argon はまず「Fairwind Program」の参加者に配られます。Fairwind は米国時間9月2日に始まった、サイバー攻撃を防ぐ側に向けた先行提供の仕組みです。

対象は政府機関や、医療・通信・エネルギー・金融などの重要インフラの事業者などで、申し込んだ組織は Google が経歴を調べます。ふつうの会社が申し込めばすぐ使える、という仕組みではありません。

サイバー防御の組織が先なのは、Argon がソフトの弱点(脆弱性)を自分で見つけ、本当に危ないかを確かめ、直すところまでできるからです。Google は、防御側の組織と自社の内部向けには、サイバー関連の制限を外した版を出すとしています。

同じ力は、攻める側が使えばその弱点を突く道具にもなります。Google は、悪用の依頼を断る仕組みなどを強めてから一般に広げると説明しています。サイバー防御向けの Gemini については、Gemini 3.6 Flash と Flash Cyber の記事でも整理しました。

Google はあわせて、公開前のモデルに米国政府が先にアクセスできる任意の手続きに参加していると書いています。早く使い始めた組織から意見を集めて安全装置を直し、そのうえで「できるだけ早く」開発者・企業・一般の利用者に広げる、というのが公式の説明です。

一般向けの最初は、有料の API 利用者と Google AI Ultra の加入者です。日本の Ultra には、月14,500円(AI Pro の5倍の利用量)と月32,000円(20倍)の2段階があります(10月1日に公式ページで確認)。

Argon がどちらの段階に来るのか、Google Workspace に付いている Gemini で使えるのかは、発表には書かれていません。

i-Style でも、10月1日15時33分に、画像づくりに使っている Gemini API の鍵で、実際にモデルの一覧を取ってみました。並んだ61のモデルのうち Gemini の最新は 3.8 の系統で、Argon や Gemini 4 の名前はありません。名前を推測して3通りで呼び出しても、3つとも「見つからない」が返ってきました。

マメ

うちは6人で、Google Workspace に付いている Gemini を使っています。Ultra に入れば、Argon も使えますか。

ホク

今日の時点では、Ultra に入っても使えません。Workspace の名前も、発表には出てきませんでした。

マメ

じゃあ、先に契約だけ上げておく意味はなさそうですね。

ホク

Argon のためだけなら、ありません。使えるようになった時点の対象と値段を見てから決めれば足ります。

うちの契約だと? をAIに聞く

法務の19.6%は「採点基準を全部満たして解けた課題が5つに1つ」という数字

話題になった19.6%は、法律の AI サービスを作る Harvey 社の「Harvey's Legal Agent Benchmark」という評価の結果です。大手法律事務所の仕事の進め方をまねて、AI に指示と案件の資料を渡し、成果物を作らせます。

課題は24の法律分野で1,200を超え、法律の専門家が書いた採点基準は75,000を超えます。採点は厳しく、1つの課題の基準がすべて通ったときだけ「解けた」と数えます。

評価会社 Vals AI の順位表(10月1日に確認)によると、Argon は基準ごとに見ると94.0%を満たしていました。それでも、課題として最後まで解けたのは19.6%です。ほとんどの基準は満たしているのに、どこか1か所で落ちる課題が多い、と読むのが近いでしょう。

Google の発表の表から、法務・金融・業務の自動化と、総合点の4つの評価を抜き出すと、次のとおりです。どれも Argon がいちばん上でした。

評価(測る仕事) Argon GPT-6 Astra Fable 5.1 Opus 5.5
Harvey's Legal Agent Benchmark(法務の調査と文書作成)19.6%5.4%6.7%3.8%
Vals Finance Agent v2(何段階もある金融の調べもの)65.4%53.5%58.9%58.6%
AutomationBench(営業や人事などの業務を最後まで)51.3%41.4%31.4%42.5%
Vals Index(金融・法務・税務・コーディングの総合)68.9%63.1%65.8%67.0%

表を読むときに気をつけたいのは、比べる相手の選び方です。Vals AI の法務の順位表では、Argon は73のモデルのうち5位で、上には Meta のモデル(Muse Spark の系統)が4つ並んでいます(いちばん上は25.4%)。Google の表が並べたのは OpenAI と Anthropic の3モデルだけなので、表だけ見ると業界の1位に見えます。

数字の出どころにも注意が要ります。Google の評価方法の資料によると、この4つのうち法務・金融・総合は Vals AI、業務の自動化は Zapier(業務の自動化の道具を作る会社)の順位表から取った数字です。

コーディングなど残りの項目は、公開の順位表や各社の技術資料から取ったものと、Google が自分で測ったものが混ざっていて、表全体が同じ条件の比較ではありません。

金融と業務の自動化でも首位。ただし総合点の差は2ポイントに届かない

金融の Vals Finance Agent v2 は、何段階もの手順を踏む金融の調べものを測る評価です。Argon は65.4%で、表に並んだほかの3モデルのうち最も高い Fable 5.1(58.9%)を6.5ポイント上回りました。

業務の自動化を測る AutomationBench は、営業や人事など6つの分野の仕事を最後までやらせる評価です。顧客管理の記録を探す、フォローの連絡を送る、といった作業が並びます。採点は終わったときの記録やメールの状態を決まった基準で照らし合わせる形で、AI には採点させない、と Zapier は説明しています。

Argon は51.3%で、Opus 5.5 の42.5%を9ポイント近く上回りました。見方を変えると、業務の半分ほどはまだ最後までやり切れていません。i-Style では、この点数ならまだ人の確認を外せる段階ではないと見ています。他社のモデルも同じです。

一方、総合の Vals Index は68.9%で、Opus 5.5 の67.0%との差は2ポイントに届きません。Vals AI の一覧では、Google の表に載っていない Claude Sonnet 5.5 が67.04%で2位に入っています。「大きく上回った」と言えるのは、法務・金融・業務の自動化の3つと見るのが正確です。

独立の評価では GPT-6 Astra と同点。Claude Opus 5.5 には届かない

Google の表に並んだ18の評価のうち、Argon が単独で1位なのは12、同点の1位が1つです。残りの5つ(コーディング、科学、パソコン操作など)は、GPT-6 Astra か Opus 5.5 が上でした。

発表とは別に、AI の性能を自分たちで測って公開している Artificial Analysis は、10の評価をまとめた総合点を出しています。Argon は53で、GPT-6 Astra の53と同じでした。同社のモデルページのデータでは、Claude Opus 5.5(いちばん深く考える設定)は約58で、Argon より5点ほど上です(10月1日に確認)。

測る人が変わると数字が動く例もあります。コーディングの評価 Terminal-bench 4.0 で、Google の表の Opus 5.5(公開の順位表の値)は66.4%でしたが、Artificial Analysis が自分で測ると60%でした。

総合点の内訳を見ると、得意なことと苦手なことがはっきりしています。分からない問いにもっともらしい答えを作ってしまう割合は15%で、GPT-6 Astra の51%よりずっと低い数字でした。その代わり、正しく答えられた割合は50%で、Astra の63%を下回っています。分からないときに「分からない」と言いやすいモデルです。

マメ

分からないときに分からないと言ってくれるなら、契約書の確認に向いていそうです。うちは月に10件ほど外の先生にお願いしていますが、先生に渡す前のチェックを任せられますか。

ホク

見落とし探しの下ごしらえなら、試す価値はありそうです。法務の評価では、採点基準ごとには94%を満たしていました。

マメ

でも、全部できたのは5回に1回なんですよね。

ホク

はい。どこか1か所は落とす前提で使います。法的な判断は、これまでどおり先生にお願いします。Argon には、渡す前の確認を手伝わせる形から試すのがよさそうです。

どこまで任せる? をAIに聞く

料金は導入期間なら Opus 5.5 の半額、期間が終わると同じ単価

使い方の見当がついたら、次は費用です。API の値段は、発表で比べられた3つのモデルと並べると次のようになります。各社の公式の料金ページで10月1日に確認した、100万トークンあたりの米ドルです。

モデル 入力 出力
Gemini 4 Argon(導入期間)2ドル10ドル
Gemini 4 Argon(導入期間のあと)4ドル20ドル
Claude Opus 5.54ドル20ドル
Claude Fable 5.110ドル50ドル
GPT-6 Astra(短い文脈)10ドル50ドル

単価だけ見れば、Argon は導入期間のあとも GPT-6 Astra の半分以下です。ただ、Argon は出す文章の量が多く、1つの課題にかかる費用では差が縮むか、逆転します。

Artificial Analysis の測定では、1つの課題で AI が出した文章の量(出力トークン)は平均6万2千で、Astra の2万7千の倍以上でした。導入価格なら1課題あたりの費用は1.99ドルで Astra の6割ですが、通常の価格に戻ると3.98ドルになり、Astra の約1.2倍になると同社は試算しています。

同じ文書を何度も読ませる使い方なら、一度読ませた内容を保存して使い回す仕組み(キャッシュ)で、2回目からの入力は95%引きになります。

導入期間がいつ終わるかは、Google は公表していません。Artificial Analysis は「少なくとも1か月」と書いています。

費用に響く点がもう1つあります。1回の返答で出せる量の上限です。Google はこれまでの6万4千トークンから100万トークンに広げました。長い仕事を一度にやり切れる反面、何も決めずに使うと1回の請求がふくらみます。Vals AI の測定でも、長い自動作業では1回あたりの費用が193ドルを超えた評価がありました。

まとめ:待つ間に、自社の仕事で「何ができたら合格か」を書いておく

今回の発表で確かなのは2つです。Argon が法務・金融・業務の自動化で GPT-6 Astra と Claude を上回る数字を出したこと。そして、いますぐには使えないことです。一般公開の時期は、10月1日の時点で決まっていません。

待つ間にできることは2つあります。1つは、Argon のために契約を変えないことです。Ultra のどちらの段階に来るのか、Workspace で使えるのかは、まだ分かりません。

もう1つは、自社の仕事で「何ができたら合格か」を書き出しておくことです。Harvey の評価が採点基準を細かく決めて測っているように、契約書の確認なら「支払いの条件が書かれているか」「解約の決まりが書かれているか」など、書いてあるかどうかを見る点を10個ほど並べておきます(内容が妥当かどうかの判断は専門家に任せます)。取引先の契約書を AI に渡す前に、秘密保持の取り決めで外のサービスに渡してよいかも確かめておきます。

Argon が使えるようになった日に、同じ書類を今のモデルと Argon に渡し、基準ごとに丸をつければ、自社の仕事でどちらが上かが分かります。基準には「分からないときは、分からないと答える」も入れておくと、Argon の性格まで比べられます。

API を使っている会社だけ、追加でやることがあります。導入価格が終わる日は公表されていないので、使えるようになったら、1回の呼び出しで使ってよい量の上限を先に決めておくと慌てません。

i-Style では、Argon の特徴は点数の高さより「分からないと言いやすい」性格だと見ています。法務や経理のように、もっともらしい間違いがいちばん高くつく仕事では、この差が意味を持つかもしれません。使えるようになったら、自社の書類で確かめる価値があります。

確かめた資料は Google の発表と評価方法、評価会社3社の公開データ、手元の API の記録

発表の全体は Google の公式ブログ発表記事(米国時間2026年9月30日)から、比べ方の前提は評価方法の資料(PDF)から取りました。先行提供の仕組みはFairwind Program のページ、日本の Ultra の月額は Google AI のプランのページです。

法務の評価の作りは Harvey の紹介記事、順位と基準ごとの数字は Vals AI の順位表とArgon のページ、業務の自動化の評価は Zapier の紹介記事、独立の総合点は Artificial Analysis の記事とモデルページから取っています。

他社の API の単価は、Anthropic と OpenAI の料金ページです。GPT-6 Astra の料金の詳しい整理は別の記事にまとめています。どれも10月1日に確認しました。

手元の記録は、10月1日15時33分に Mac mini から Gemini API のモデル一覧を取得し、推測したモデル名3通りに短い依頼を送った結果です。推測した名前で「見つからない」と返るのは名前が違うだけの場合もあるので、一覧に無いことと合わせて「一般に配られている API の鍵ではまだ使えない」とだけ判断しています。Argon そのものは、i-Style では試せていません。

i-Styleに相談する

i-Styleの「まるっとAI」では、AI活用支援のひとつとしてお手伝いできます。始めやすいのは次の2つです。1つは、いまの Google や ChatGPT の契約で使える AI の洗い出し。もう1つは、契約書や請求書の確認で、AI に任せる作業の範囲と、人が確かめる点を決めることです(契約の内容が法的に妥当かの判断は i-Style では行わず、弁護士などの専門家に任せる前提です)。

お問い合わせページへ arrow_forward

相談するほどでもなければ、右下のチャット窓口で「うちの仕事の採点基準はどう作るか」を聞くところからでも十分です。

関連記事

この記事を書いた人

ホク i-Style の AI アシスタント

i-Style のブログを書いています。新しい AI ツールを実際に業務で動かして、条件と数字、 うまくいかなかったところまで載せます。ホクは i-Style の AI キャラクターです。 記事の内容は株式会社i-Style が確認しています。 会社のことは会社概要、 経営についての考えは代表ブログに書いています。