上週幫一群麻醉科的醫師朋友上了一堂 AI agent 上手課。課後回饋很有意思:「權限框與 auto mode」同時出現在兩張名單的前段,投「最有收穫」的人很多,投「沒聽懂」的人也很多。代表這東西重要,但一堂課的節奏講不完。這篇把它一次講完整。

還沒裝起來的朋友,可以先看從零開始用 AI agent那篇,裝好再回來。

權限框是什麼:它動手之前,先舉手

第一次叫 Claude Code 或 Codex 整理資料夾,最不習慣的就是它一直跳框問你「可以嗎?」。

這個框其實是整套系統最重要的安全設計:AI agent 要動你電腦裡的東西之前,必須先讓你點頭。框裡通常有三個部分:

  • 它想跑的指令:一行終端機指令,像 lsmkdirrm
  • 它自己的白話解釋:指令下面那一兩行,說明它想做什麼、為什麼
  • 你的選項:同意這次、同意以後都不用問、拒絕

你不需要會終端機指令。你只需要看得懂那行白話解釋,然後判斷「合理嗎」。看不懂的時候有兩招:

看不懂它想幹嘛的兩招

  • 直接回它:「用五歲小孩能懂的方式解釋你現在要做什麼」(英文縮寫叫 ELI5,Explain Like I’m 5,AI 都看得懂)
  • 把那行指令複製,貼給網頁版的 AI 問「這個指令會做什麼?有風險嗎?」

四種模式:按 Shift+Tab 切換

每一步都問你,等它做完一件事你可能按了二十次同意。所以 Claude Code 提供好幾種模式,按 Shift+Tab 就能輪流切換,畫面上會顯示目前在哪個模式。日常用得到的是這四個:

模式它會怎樣什麼時候用
default(預設)每個會改到東西的動作都先問你剛開始建立信任的階段
plan mode只能讀、不能寫,先研究再給你一份計畫想先看它打算怎麼做;要碰重要資料的第一步
accept edits檔案編輯自動放行,跑指令仍會問改稿、寫筆記這類編輯密集的工作
auto mode系統自動判斷每條指令危不危險:安全的直接放行,危險的攔下來問你日常主力

(Claude Code 其實還有更多模式,像給無人值守環境用的 bypass permissions,那些跟日常上手無關,先不用管。)

auto mode 為什麼反而比較安全:警報疲勞

臨床的人對 alarm fatigue 都不陌生:monitor 什麼都叫,叫久了大家聽到聲音只是伸手把它按掉。權限框也一樣。當每一個框都要你同意,你很快就會停止閱讀,變成反射性按同意。這時候「每步都問」給你的不是安全,是安全感。

Anthropic 今年八月發表了一個實驗,找了 1,053 位付費測試者,在正常的操作過程中偷偷混入明顯危險的指令,看有多少人會發現:

  • 人工逐框審查,只有 13.6% 的人抓到危險指令
  • 按到第 50 個框以後,抓到率掉到大約 5%
  • 交給系統的分類器先篩,89% 的危險指令被自動攔下,而且不會疲勞

Anthropic 1,053 人實驗:人工逐框審查只抓到 13.6% 的危險指令,按到第 50 個框以後掉到約 5%,交給分類器先篩則攔下 89%

這也是為什麼從 2026 年 8 月中開始,訂閱版的 Claude Code 預設就是 auto mode。你新裝好打開,很可能已經在這個模式上了。

但書,官方自己講的

89% 不是 100%,還有 11% 會漏。所以 Anthropic 自己也說:分類器不能消除風險,重要的變更(例如會影響到正式環境的東西)仍然建議人工看過。另外有幾條硬規則不受模式影響,例如刪掉 .git.claude 資料夾這類動作,永遠不會被自動放行。

我自己的做法是切著 auto mode,但心裡留一張紅旗清單,這幾個字出現就自己看一眼再按:

  • rmdel:刪東西
  • git push、deploy:把東西發佈出去
  • 任何要寄信、發文、對外送資料的動作

判斷原則一句話:可復原的放給它做,不可復原的自己看。權限這件事還有另一半,是你把哪些鑰匙放在它拿得到的地方,我在把家裡的鑰匙盤一遍那篇寫過。

Codex 那邊怎麼設:/permissions 的三檔

課後有人問:「Codex 是不是沒有 auto mode?」有對應的東西,只是名字和路子不一樣。以下是我在自己電腦的 codex-cli 0.147.0 上確認過的:

  • 在對話裡輸入 /permissions,會看到三檔:
    • Read Only:只能讀,任何修改都要經過你
    • Default工作資料夾裡面的編輯和例行指令直接做,要動到資料夾以外、或要連網路,才跳出來問你
    • Full Access:什麼都不問。新手請直接當它不存在
  • Default 這一檔在舊版文件裡就叫 Auto,它就是 Codex 版的「安全的自動、危險的問人」

兩家的設計哲學不太一樣,順便講清楚:Claude Code 是逐條判斷,用一個分類器評估每個指令危不危險;Codex 是先畫一個圈,用沙盒(sandbox,一道技術上的圍籬)把它關在你的工作資料夾裡,要出圈才需要你點頭。殊途同歸,你要記的只有一件事:兩邊都有「安全的自動放行、危險的攔下來問」這一檔,而且都是新手該用的那一檔

上手的順序

  1. 第一週:用 plan mode(Codex 用 Read Only),拿自己的真實資料夾練,先看它「打算」怎麼做,不讓它真的動手
  2. 看得懂權限框之後:切 auto mode(Codex 切 Default),把注意力留給紅旗指令
  3. 紅旗出現時:停下來讀那行白話解釋,不確定就 ELI5,或貼給網頁版 AI 問

有了這個設定之後,你省下來的不只是按同意的手,而是注意力。逐框審批的力氣省下來,可以花在真正要緊的驗收上:資料夾真的整理對了嗎?筆記裡那條引用,真的在書的那一頁嗎?怎麼跟它把任務交代清楚,我在我怎麼跟 AI agent 講話那篇有完整寫過,可以接著讀。

參考資料