claude-paper-tools 的 GitHub 風格封面卡,標示兩個 skill:評估可信度的實證醫學評讀,與三層結構快讀、生成自我測驗的內容吸收

我把 journal club 的「讀論文腦」寫成了 AI skill,還逼它不能靠印象唬爛

前面分享的論文學習小站,有個「品質」、「內容」按鈕,那時沒有把背後的實作放出來。算是個有前端網頁,但後端還是要靠自己整理的平台。不過我自己的實作,當然後端還是要接給 AI,減輕認知的負荷,這裡就是把後端兩個 skill 分享出來,加速大家學習速度囉! — 一個負責「這篇可不可信」 第一個叫 paper-review,做的是 journal club 那種評讀。 依研究設計自動選對工具 它會依照論文的類別,選用建議的評讀工具,隨機對照試驗(randomized controlled trial)用 Cochrane RoB 2、觀察性研究用 ROBINS-I、系統性回顧用 AMSTAR-2、診斷準確度用 QUADAS-2,而不是拿一張萬用 checklist 硬套。這件事聽起來理所當然,但你知道大部分「AI 幫你看論文」其實就是一張萬用 checklist 套到底。 引用查核:先確認文獻「真的存在」 我最喜歡的一關是引用查核。它會先去 CrossRef 確認每一篇被引用的文獻「真的存在」,再比對「論文說這篇文獻講了什麼」跟「這篇文獻實際上講了什麼」。 為什麼要先查存不存在?因為 AI 寫出來的引用,沒稽核的話正確率其實只有四到八成,假 DOI、張冠李戴的狀況比想像中多。所以這一步是一個很便宜、但很有用的防呆。 統計顯著不等於臨床顯著 還有一個地方我很堅持:統計顯著不等於臨床顯著。所以它會把效果量拿去跟量表的最小臨床重要差異(minimal clinically important difference, MCID)比,p 值小於 0.05 但根本沒過 MCID,它就會直接講出來。 整體借鏡了林協霆醫師的分享,還有之前學 EBM 的內容,大家也可以再加入你覺得重要的部分。 — 重點:我不讓 AI 靠「印象」給分 這是這次我自己覺得最有意思的部分。 一開始我讓 Claude 自己算證據等級(GRADE)、自己判斷「結論有沒有超過資料能支撐的範圍」。但我後來覺得不對,因為這種東西讓語言模型「憑整體感覺」給一個分數,它其實很會講得頭頭是道,可是你沒辦法檢查它到底怎麼得出來的。 所以我乾脆寫了兩支確定性的小程式,把「判斷」跟「計算」分開: grade_judge.py:把 GRADE 變成算術 語言模型只負責評五個面向(risk of bias、inconsistency、indirectness、imprecision、publication bias),每個面向給「不嚴重/嚴重/很嚴重」。真正的最終等級由程式加總算出來,不是模型自己講。模型自報的等級只當參考,如果跟程式算的不一樣,程式還會跳出來提醒「這兩個對不上,回去重看某個面向」。 它甚至會幫你擋掉 GRADE 的規則錯誤,例如觀察性研究只要有任何一項被降級,就不准再往上升級,這個規則模型很容易記錯,程式不會。 argdown_lint.py:把結論的邏輯漏洞變成可以檢查的東西 這支更好玩。語言模型負責把論文的結論、還有每一個「用來支撐結論的發現」標上類型(這是隨機對照試驗的直接證據?還是只是相關性?還是只是替代指標?還是只是次要 outcome?),然後由程式判斷這個推論跳得合不合法。 例如「用替代指標的改善,去宣稱對真正的臨床終點有效」、「用相關性去宣稱因果」、「用單一研究去宣稱『一致地顯示』」,這些都是論文 spin 最愛躲的地方。程式抓到就直接標紅、回報有漏洞。 ...

July 7, 2026 · 1 分鐘 · 103 字 · 陳柏威 Po-Wei Chen
一隻友善的機器人把雜亂紙張收進有標籤的抽屜,乾淨的桌面只留一張關鍵的紙

幫 AI 整理一張乾淨的工作桌

📖 省 Token 系列(共四篇):第一篇 為什麼你的 AI 越聊越笨 · 第二篇 能用算盤就別開超級電腦 · 第三篇(本篇)· 第四篇 我幫 AI 裝了一個省錢儀表板 前兩篇都還停在「人人可用」的層次。從這篇開始,我帶你看我電腦裡那套被我折騰到很細的設定。 先說背景。我除了在手機上用 AI 聊天,更常用的是一個叫 Claude Code 的工具:它跑在電腦的終端機裡,可以直接讀我的檔案、改我的筆記、幫我自動化一堆事。你可以把它想成「一個住在我電腦裡、能動手做事的 AI 助理」。 正因為它能做的事多、跑的次數多(一個任務動輒呼叫 AI 幾十上百次),省 token 在這裡的回報會被放大很多倍。而省 token 的第一原則,跟整理書桌一模一樣: 桌面上只放現在用得到的東西,其他都收進抽屜。 常駐稅:有一種成本,你每一句話都在付 我有一個檔案叫 CLAUDE.md,裡面寫著我給 AI 的長期規則:筆記要用什麼格式、哪些資料夾不要碰、我的偏好是什麼。 這個檔案有個特性:它在每次開工的最一開始就被載入,而且整段工作過程都常駐在 AI 眼前,不會被收走。 意思是,如果這個檔案有 5000 個 token,那麼無論我今天只問兩句、還是聊兩百句,每一句的背後都在重複付這 5000 個 token 的錢。 我把它叫做「常駐稅」。每一行都是稅。 所以我刻意把它壓在 95 行左右,只留真正穩定不變、非寫不可的規則。會議記錄、設計過程、長篇說明,全部移到別的地方,要用的時候才叫出來。 順帶一提,這些「只給 AI 看」的設定檔,我一律用英文寫。因為中文在 token 計算上比較貴(同樣意思的中文通常比英文吃更多 token),而給人看的筆記我才用中文。給 AI 的省錢,給人的好讀,各得其所。 抽屜:讓記憶分層,不要全攤在桌上 我給 AI 做了一套記憶系統,但重點不是「記越多越好」,而是分層: 真正天天用到的,放在最上層,每次開工自動載入。 偶爾才用的,收進抽屜,需要時才拉出來。 很久沒碰的,直接封存。 我還做了一個「使用熱度」的計分:常被讀到的記憶分數高、留在桌上;冷掉的自動往下沉。這樣桌面永遠只有當下最相關的那幾張紙。 道理跟上一篇的算盤一樣:這套熱度排序是用程式算的,不勞駕 AI。 這對手機聊天版的人也有啟發:ChatGPT 的「記憶」和「自訂指令」功能不是免費魔法,它是每次對話前自動幫你貼上去的隱形內容,一樣佔空間、一樣每句重算。所以記憶要精簡,不是塞越多越好。 ...

June 29, 2026 · 1 分鐘 · 143 字 · 陳柏威 Po-Wei Chen
一隻友善的機器人看著有預算錶針的儀表板,指針在節奏正常區,token 金幣流進小豬撲滿

我幫 AI 裝了一個省錢儀表板

📖 省 Token 系列(共四篇):第一篇 為什麼你的 AI 越聊越笨 · 第二篇 能用算盤就別開超級電腦 · 第三篇 幫 AI 整理一張乾淨的工作桌 · 第四篇(本篇,完結) 來到系列最後一篇。前三篇我們從「為什麼 AI 越聊越笨」,一路講到「什麼時候別用 AI」「怎麼幫它整理桌面」。這一篇談的是錢真正花下去的那一刻:怎麼把每一塊錢花在刀口上。 第一件事:不是每件事都需要最聰明的腦袋(但省下來,就是為了負擔得起好的) AI 模型有分等級。以 Claude 為例,由便宜到貴大致是 Haiku、Sonnet、Opus 三級,價差很大。 如果你是按使用量付費的人,最直接的省法就是「派對的等級做對的事」:改格式、重新命名、簡單分類這種雜事,交給最便宜的 Haiku 就好;日常的寫作、查資料用中間的 Sonnet;只有真正需要深度推理的硬任務,才動用最強的 Opus。 這裡還有一個很多人都搞錯的觀念,特別講一下:「要看圖」不等於「要用最貴的模型」。 當你只是要 AI「看一張圖、認出裡面有什麼、把上面的字讀出來」這種辨識任務,最便宜的 Haiku 通常就完全夠用,便宜到一個誇張。只有要它「看懂一張複雜的醫學示意圖、解讀圖表背後的邏輯」這種需要推理的視覺任務,才值得升級。選模型的真正標準,是「這個任務需要多少思考」,不是「要不要看圖」。 不過老實說,我自己現在反而大多直接用最強的 Opus,XD。 為什麼?因為我發現,在目前的訂閱方案下,把前面三篇那些省 token 的功夫都做好之後,我的額度其實用不太完,而最強的模型品質又明顯比較好。所以對我來說,與其斤斤計較每件事該用哪一級,不如把省下來的額度,拿去讓最好的模型做每一件事。 我覺得這反而是整個系列最想講的一件事:省 token 從來不是為了小氣。 我把浪費擋掉、把該交給程式的交給程式、把桌面整理乾淨,省下來的這些,剛好讓我負擔得起「把最好的腦袋,用在每一個我在乎的問題上」。省,是為了能大方地花在刀口上。 最後補兩個進階的小心法: 讓 AI 少廢話,可以一勞永逸。 AI 的「輸出」比「輸入」貴上好幾倍(以 Opus 為例差到五倍),所以請它回答精簡就是直接省錢。而且這件事你不用每次重講,直接寫進給它的長期指令裡(就是第三篇那份常駐設定檔,或聊天版的「自訂指令」),叫它預設就講重點、不要長篇大論。一次設定,之後每次都省。 思考深度也能調。 同一個模型可以設定它「想多深」,簡單的事用淺一點、難的事才開深度思考。重點永遠是:把力氣花在真正難的地方。 第二件事:把吵鬧的雜事,丟到隔壁房間做 有些工作會吐出一大堆過程訊息:跑一輪測試、抓一份長文件、處理一堆紀錄。如果讓這些雜訊全部堆在主對話裡,桌面馬上被淹沒(回到第三篇,桌面一髒就又貴又笨)。 我的做法是派一個「分身」去隔壁房間做這件事。分身有自己獨立的工作空間,它的所有過程、雜訊、草稿都留在那個房間裡,只有最後的結論回到我的主對話。 這就像你請助理去查一整天資料,你不需要看他翻過的每一頁,只要他最後給你一頁重點。 但這招有取捨,我必須老實說:派分身本身也要花錢,而且分身會自己燒一輪 token。官方就提醒過,大量用分身的工作流,總花費可能是單打獨鬥的好幾倍。所以原則是:當「保持主桌面乾淨」的價值,大於「多請一個分身」的成本時,才派。 不是什麼都丟分身。 (這篇從頭到尾,你會發現省 token 沒有一招是無腦的,每一招都在權衡。這正是它好玩的地方。) 第三件事:裝一個會對我跳表的儀表板 講了這麼多省法,最後一塊拼圖是:你得看得見自己花了多少。 看不見的支出最危險。所以我裝了一個開源小工具,叫 cc-budget(由 boyand 開發,在 GitHub 上找得到)。 ...

June 29, 2026 · 1 分鐘 · 167 字 · 陳柏威 Po-Wei Chen
計程車跳表上扛著被 token 金幣壓垮、下沉的對話泡泡,一隻友善的機器人吃力地拖著它

為什麼你的 AI 越聊越慢、越聊越笨?

📖 省 Token 系列(共四篇):第一篇(本篇)· 第二篇 能用算盤就別開超級電腦 · 第三篇 幫 AI 整理一張乾淨的工作桌 · 第四篇 我幫 AI 裝了一個省錢儀表板 你一定有過這種經驗:跟 ChatGPT 或 Claude 聊一個下午,越到後面它越遲鈍,回得越慢,還會突然「忘記」你前面講過的事,甚至開始鬼打牆。 很多人以為是自己網路慢,或是 AI 當機。其實不是。這背後有一個大多數人不知道、但知道之後會立刻改變你用法的真相。 真相一:AI 其實沒有「記憶」 我們直覺以為,AI 像人一樣,聊著聊著就「記住」了對話。 它沒有。 每一次你按下送出,AI 都把你們從第一句到現在的整段對話,從頭重讀一遍,然後才回你下一句。它不是接著上一句講,而是每次都把整本對話重新看過。 所以你可以想像:對話越長,它每回答一句之前要重讀的東西就越多。這就是為什麼越聊越慢。 真相二:你其實一直在付錢,只是看不到帳單 AI 處理文字的單位叫 token(大致是一個字或半個詞)。你輸入的每個 token、它輸出的每個 token,背後都在計費。 最好記的比喻是:token 就是 AI 的計程車跳表。 距離(字數)越長,車資越高。 你在訂閱制的 App 裡看不到這張帳單,但它換了一張臉出現在你面前:就是那個「你今天的訊息額度已用完」,還有「怎麼越來越慢」。額度和卡頓的背後,都是 token 的運算量。 而且這筆帳不是線性疊加的。對話長度加倍,你付的運算量不是兩倍,而是接近四倍(這是 AI 內部運算機制的數學特性)。難怪長對話的卡頓感像在爆炸。 真相三:越塞,反而越笨 這點最反直覺,但最有用。 AI 的「注意力」是有限的,所有注意力加起來永遠等於一份。你塞進去的內容越多,每個重點分到的注意力就被稀釋得越薄。多餘的廢話會偷走本該分給關鍵問題的專注力。 這不是我隨口說的。一篇很有名的研究 Lost in the Middle(Liu et al., 2024)發現一個 U 型曲線:資訊放在對話的開頭或結尾,AI 記得最牢;但埋在中間的重點,記得的機率會掉到只剩大約兩成。難怪它常常把你中間講的事忘光光。 另一份 Chroma 在 2025 年的研究測了 18 個主流模型,發現它們全部都隨著輸入變長而表現下滑,這現象被叫做 context rot(脈絡腐化)。 ...

June 29, 2026 · 1 分鐘 · 150 字 · 陳柏威 Po-Wei Chen
左邊一台溫暖的木製算盤,右邊一台發光但耗電的超級電腦,中間隱含天秤,象徵選對工具

能用算盤,就別開超級電腦:什麼時候該叫 AI 動腦?

📖 省 Token 系列(共四篇):第一篇 為什麼你的 AI 越聊越笨 · 第二篇(本篇)· 第三篇 幫 AI 整理一張乾淨的工作桌 · 第四篇 我幫 AI 裝了一個省錢儀表板 上一篇我們講到,跟 AI 對話越長越貴越笨,以及三個立刻能用的省法。這一篇要往前再走一步,談一個更根本的分水嶺: 有些工作,根本不該叫 AI 來做。 聽起來很反骨,但這正是我把 AI 用得省又準的關鍵心法。 兩種工具:算盤與超級電腦 把事情交給電腦處理,其實有兩條完全不同的路。 一條是寫死的程式(script)。你事先把規則想清楚、寫成步驟,之後它就照著跑。像一台算盤,撥珠的規則固定,算十次一百次答案都一樣。 另一條是叫 AI 動腦(LLM)。你描述需求,它「理解」之後生出答案。像一台超級電腦,什麼模糊的、需要判斷的都能接,但每開機一次就燒一次電。 很多人的直覺是:現在 AI 這麼強,什麼都丟給 AI 就好。 這恰恰是燒錢又燒時間的根源。 一張表,看懂兩者的取捨 面向 寫死的程式(算盤) 叫 AI 動腦(超級電腦) 精準度 100% 確定,同樣輸入永遠同樣結果 會漂移,同一個問題問兩次可能答案不同,還可能一本正經地胡說 模糊處理 只能做規則講得清楚的事 能處理語意、判斷、例外、「你懂我意思」那種模糊地帶 花費 幾乎是零 每跑一次都付一次 token 的錢 速度 毫秒級,眨眼就好 秒級,而且對話越長越慢 前置工 要先把規則想對、寫對 開口就能用,零設定 看懂了嗎?兩者沒有誰比較好,只有誰適合這個任務。 規則明確、會重複很多次的事,交給算盤:又快又準又免費。 需要判斷、模糊、每次都不太一樣的事,才值得開動超級電腦。 一個真實的例子:我怎麼讀我的醫學課本 PDF 我有很多教科書的 PDF,常常需要從裡面撈內容。 如果我每一頁都直接丟給 AI 看,那是把超級電腦當印表機用:每一頁都付一次「看圖加讀字」的錢,貴得嚇人(後面那篇會講,直接丟 PDF 給 AI 看,每頁可能燒掉一兩千個 token)。 ...

June 29, 2026 · 1 分鐘 · 169 字 · 陳柏威 Po-Wei Chen
復健科進修雷達 courses.drpwchen.com 網站畫面

做了一個復健科進修雷達

當住院醫師到現在,每次想找進修課程都是同個痛點:超音波、全衡、足踝、神經、兒復⋯⋯課程散在十幾個學會跟機構的網站,沒幾天就要刷一次網站,又不確定自己到底看過沒。 後來我把這些課程頁放到家裡的 Home Assistant 做爬蟲,有新課就自動通知我,終於輕鬆很多。不過想到再過不久就要離開住院醫師階段,這套擺在家裡的小工具就沒辦法繼續提醒學弟妹們。想說反正有 Claude,乾脆請他把這 17 個復健相關學會/機構的課程跟公告全部爬下來,彙整成一個地方,每 3 小時自動更新一次,放上網路給大家用。 於是就有了這個網站: 👉 https://courses.drpwchen.com 網站內容: 📅 最新課程:一頁看完,可以按活動日期排序、排除過期、依分類跟來源篩選 🗓️ 活動行事曆:這個月有哪些課一目了然 📣 最新公告:各學會的最新公告也一起收 🔔 訂閱通知:想被通知的話可以訂閱 RSS 或 ntfy,有新課程自動推播,不用再自己巡網站 幾點說明: 資料自動彙整自各學會/機構的公開公告頁,僅顯示標題與連結並導回原站,屬非官方彙整,實際資訊請以原公告為準 不用登入,點擊活動就能直接打開原始公告頁面 純粹是做給自己用的工具,順手開放出來,希望也幫助到同科的大家~ 如果你發現少了哪個學會、哪個機構,或想到什麼功能,歡迎跟我說,我再加進去!🙌 如果這個工具有幫你省下時間,也歡迎請我喝杯珍奶,讓伺服器繼續轉下去 🧡 請我喝珍奶!

June 24, 2026 · 1 分鐘 · 33 字 · 陳柏威 Po-Wei Chen
把圖檢索加進醫學筆記庫

把圖檢索加進我的醫學 LLM Wiki,這次真的有用了

背景:我本來就在用的東西 念專科考試的時候,我給自己弄了一套 RAG(Retrieval Augmented Generation),用「看相似度」的語意搜尋(semantic search)把幾百本復健科教科書跟我自己的筆記變成可以查、可以問的東西。一邊在 Obsidian 裡讀書用,一邊讓 Claude 透過 MCP 也能找到我要的東西。 它目前最弱的地方,就是「跨文獻把知識串起來」。所以前幾天看到有人分享一篇剛發表的論文 SAG(SQL-Retrieval Augmented Generation),說可以在語意搜尋之外加上結構化查詢語言(SQL)跟圖的概念,讓跨文獻搜尋更容易,效果類似 GraphRAG 但更好維護、更好建立,我整個眼睛一亮。 在這時代想當然爾,就是把論文連結丟給 Claude,請他去讀論文、抓原作者的 GitHub、讀懂作法,然後用我自己的資料把整條管線複現出來、實際跑 benchmark XD 論文:Wu et al., SAG: SQL-Retrieval Augmented Generation with Query-Time Dynamic Hyperedges, arXiv:2606.15971。程式碼:github.com/Zleap-AI/SAG-Benchmark 第一步:選模型(RTX-3070 的眼淚) 整條管線裡最關鍵的一步,是用 LLM 把每段文字抽成「事件 + 實體」存進資料庫。原論文用 Qwen,我就比了本地的 Qwen(qwen3.5:4b)跟線上的 Claude Haiku。 結果 Haiku 萃取資訊的能力明顯比較好,實體圖更密、命名更一致(這對後面用 SQL 串很重要),而且看起來很便宜。這跟我先前的經驗相符,可能我的 RTX-3070 真的太弱了,稍微大一點的模型就跑不動(時代的眼淚阿),直接用 Haiku 又快又好! 順帶一提,我沒有 API 訂閱也能用 Haiku:直接派 Claude 的 subagent 去做,跑在既有額度內就好。 教科書上的三個發現 我用神經復健的教科書當測試語料,設計了一批臨床問題,拿 SAG 跟原本的語意搜尋正面對決。結果分三關: 第一關,單一本書:打平。語意搜尋已經夠強,多跳機制沒用武之地。 第二關,跨書、但問題裡把關鍵字都寫白了:還是打平。因為問題裡已經把「中風、脊張力、步態」全寫出來,語意搜尋自己就把相關段落都撈回來了。 第三關,跨書、但只問一端、中間那跳故意不講(例如只問「馬蹄內翻足怎麼處理」,期待它自己連到背後的脊張力機轉跟治療):SAG 終於贏了,而且贏很多。 ...

June 22, 2026 · 2 分鐘 · 387 字 · 陳柏威 Po-Wei Chen