ファイルを1つ書く。コマンドを1つ走らせる。検索を1回する。そのたびに「許可しますか」と聞かれます。1日積み重なると、相当な回数です。作業そのものより、この確認のほうが疲れる日もありました。
Anthropicが出したAuto modeは、ここに切り込む機能です。噛み砕いて言うと、AIが自分の操作の安全性を判定して、安全なものは自動で通す仕組み。i-Styleの開発で丸1日使い倒したので、その肌感覚と、AIへの権限の渡し方をまとめます。
先にまとめ
確認を全部押すか、全部飛ばすか。その二択のあいだに立つのがAuto modeです。安全な操作は止めず、危ない操作だけ止める。公表値では、止めるべきでないものを止めた割合が0.4%、止めるべきものを通した割合が17%。無防備ではないが、完璧でもない。使い分けの線引きが要ります。
Claude Codeを使っていて確認の多さを感じている方、AIにどこまで任せるかを設計している方に向けた内容です。本番環境の直接編集だけが対象の方には向きません。
確認が意味を失っていた
公式によると、Claude Codeの利用者は表示される承認画面の93%を承認しているそうです。ほぼ全部「はい」を押している。数字で見ると、確認の意味はほとんど失われていたことになります。
かといって、確認を全部飛ばす設定もあります。ただ、こちらは名前からして「危険」と書いてあるとおりで、本番のリポジトリを壊しかねない操作まで素通りします。使う気になりません。
Auto modeは、その2つのあいだに立つ中間の層です。安全な作業は止めない。危険な作業はきちんと止める。承認疲れにも、無防備にも振り切らない。現実的な落としどころだと感じました。
判定は2段階で行われる
仕組みは2段階です。まず、外から取り込んだ文書やページに、妙な指示が紛れ込んでいないかを先読みする。次に、AIが取ろうとしている操作そのものが安全かどうかを、直前に別の判定役が見る。
ここで面白いのが、後半の判定役はClaude自身の言い分を見ないという設計です。見るのは、ユーザーの指示と、実際に呼ぼうとしている操作だけ。自分の判断を自分で正当化する循環を、構造で断ってあります。第三者の審判を置いた形です。
操作そのものも、あらかじめ3つの層に分けられています。ファイルの読み込みや検索のような安全な操作は、そもそも止まらない。プロジェクト内のファイル編集は、履歴で後から追えるので自動で通す。それ以外、つまりコマンド実行や外部への接続は、1件ずつ判定にかける。
「後から取り返せるかどうか」で層を分けている、と読めます。この考え方は、AI以外の権限設計にもそのまま使えます。
数字で見ると、無防備ではないが完璧でもない
公式が実際の通信で測った数字が出ています。読み方を含めて並べます。
| 指標 | 値 | 意味 |
|---|---|---|
| 偽陽性率 | 0.4% | 通してよい安全な操作を、誤って止めた割合 |
| 偽陰性率 | 17% | 止めるべき操作を、誤って通した割合 |
0.4%は、体感としてはほとんど止まりません。だから作業がなめらかに進みます。一方の17%は、5回に1回近くを見逃す計算です。ここを見ずに「安全になった」と受け取ると危ない。全部飛ばす設定よりはるかに安全、けれど無防備ではない。この位置づけで使います。
丸1日使ってみた肌感覚
コーポレートサイトを1日かけて大きく改装しながら、ずっとAuto modeで動かしてみました。記事の執筆、ファイルの編集、CSSのビルド、スクリプトの実行。体感で8割以上は止まらずに流れます。
外に出る操作も、必要なところは通りました。一方で、履歴を強制的に上書きする種類のpushは、きちんと止まりました。ここは止めてほしいところです。もう1つ、公開用の設定ファイルを編集する際に、外部の入力をそのままコマンドへ渡す書き方をしていたら警告が出て、書き換えを求められました。指摘としては、まったく正しい内容でした。
一番大きかったのは、クリックの回数が減ったことではありません。クリックする意味のある場面だけが残ったことです。止まったときに「なぜ止まったのか」を考えるようになる。惰性で押していた頃より、確認の質は上がりました。
向く場面と、向かない場面
向いているのは、繰り返しの多い作業です。記事やドキュメントの更新。静的サイトのデザイン調整。数十ファイルにまたがる単純な整理。ビルドやテストのような、何度も走らせる作業。
向かないのは、本番データベースの変更、顧客データを直接いじる作業、認証まわりの重要な変更、そして自分がまだ全体を把握できていない領域です。最後の1つは見落としがちですが、大事です。止まったときに、それが妥当かどうかを判断できないからです。
判断の基準は1つでいい
事故ったときの取り返しのコストが大きい操作だけ、手動に戻す。それ以外は流す。層の数を増やすより、この1本で線を引いたほうが現場では守られます。
30分でできる実験
読むより、触るほうが早いです。いつもの作業をAuto modeで30分だけ回して、止まらなかった操作と止まった操作を1行ずつメモしてください。そのあとで、止まったほうを「止まってよかった」か「過剰だった」かで分けます。
30分で、自分の業務における安全な範囲が肌感覚で見えてきます。チームへ入れるかどうかを決めるときの材料にもなります。
まとめ:全部任せるでも、全部見張るでもなく
Auto modeが見せたのは、操作を層に分けて、層ごとに委ね方を決めるという発想です。全部任せるか、全部見張るか。その二択で考えているうちは、たいてい前者に振り切って事故るか、後者で疲れて続かなくなります。
自社の業務でも、いまのうちに「どの操作なら止めずに流してよいか」を言葉にしておくと、道具が進化したときにすぐ乗れます。冒頭の確認疲れは、道具のせいというより、線を引いていなかったせいでもありました。
参考: Claude Code auto mode: a safer way to skip permissions(Anthropic Engineering Blog)
Claude Code をまだ試していない方へ
本記事で取り上げた Claude Code は、AI と対話しながらコードを書く開発環境です。下のリンクは紹介用のリンクです。特典の内容や条件は時期によって変わるため、最新の内容はリンク先でご確認ください。
AI を業務にどう組み込むかの設計から、i-Style がご一緒します。チームへの定着まで現場感のある手順で伴走します。
関連記事