2026-06-11

閱讀 : 分鐘

0  則留言

Claude Fable 5 實測:把 AI 當資深工程師會怎樣

By 追日Gucci

2026-06-11


☕️我的文章對你有所幫助嗎?那麼考慮請我喝杯咖啡吧!☕️

Loading

Anthropic 放出了 Claude Fable 5 跟 Mythos 5。官方公布的基準測試數據大幅領先自己跟其他對手,文章裡還秀了一段案例:金流公司 Stripe 處理五千萬行程式碼的搬遷,本來要整個團隊花兩三個月,用新模型一天就做完

但你應該跟我一樣,看到新模型出來已經無感了。官方每次都說基準測試怎樣怎樣,實際用起來的體驗差異卻沒那麼大。所以你心裡一定有個問題:這個新模型到底值不值得花時間跳進去用?

我不細講跑分。我只做一件事:把我每天在用的 YouTube 影片生產流程裡,一個長久以來不好處理的問題,直接丟給 Fable 5 實測。先說結論:它通過了。但過程裡它做了一件我沒要它做的事,幫我把一個我自己沒想到的問題抓出來,那一段比結論更值得看。

文末我會把我給它的那份開發模板直接給你,抄了就能用在你的工作流。而且這件事有期限:Fable 5 免費開放給訂閱用戶只到 6 月 22 日。

Fable 5 到底是什麼

你可能對 Fable 這個名字很陌生。它就是幾個月前傳出來的那個 Mythos:等級跟以往模型完全不同的大語言模型。Mythos 因為太強,只開放給特定族群,像資安開發者、跟美國國防相關的機構。

Fable 5 是 Mythos 開放給一般人用的安全版本。遇到資安攻擊這類安全性問題時,它會退回 Opus 的模型。簡單講:Fable 5 就是神級模型的民用版。

Claude Fable 5 名詞解釋:Mythos 5 的安全公開版本與計費方式

費用的部分先講清楚。現在 Claude 的 Pro、Max、Team 訂閱方案都直接內含 Fable 5,但只到 6 月 22 日。之後要走 API 或用量點數付費,每百萬詞元(token)輸入 10 美元、輸出 50 美元,是 Opus 的兩倍。換句話說,你大概有兩個禮拜可以不多花一毛錢,去試這個到目前為止最強的模型。

手繪插畫:工程師從緊盯 AI 每一步,轉變為在白板上指出目標讓 AI 自主完成

最重要的觀念:給目標,不要給步驟

進實測之前,先講這支影片最重要的一個觀念。你只要記住這一點,今天就值得了。

以前用 Claude 或 Cursor 開發,流程通常是:下指令讓 AI 做,人工檢查(或讓 AI 檢查),有問題再叫它改。人卡在中間不斷輸入、不斷循環,像一個主管盯著員工,一步都不敢放。

到了 Fable 5,問題不再是它做得對不對,而是確認它做的是對的事情。你的工作從檢查它的每一步,變成確認它走的方向是你要的。

具體來說,用法有三個改變,這三條是 Anthropic 官方建議的:

  1. 把它當同事用。 像平常跟同事工作那樣,不斷跟它討論:這個方法你有什麼建議?有沒有更好的切法?
  2. 給大目標,不給小碎步。 模型已經聰明到你可以直接把第十步要的終點給它,讓它自己找路。但給目標不是丟一句話就好,要帶上你的驗收標準、什麼情況要停下來問人、怎樣才算做完,寫清楚它跑出來的結果才會是你要的。
  3. 把野心放大。 以前你覺得 AI 做不到的事,現在都值得重新丟一次。

我要補一條官方沒講、我自己試出來的:模型越強,你越要把設計的邊界講清楚。 不要因為它變強了就隨便要求它。你隨便給,它只是更快地把錯的事情做完。怎麼設邊界,下面實測就會看到完整做法。

用法的四個改變:當同事、給大目標、放大野心、講清楚邊界

環境設定

進 Claude 的命令列工具之後,預設選不到這個模型,要自己下 /model claude-fable-5 切過去。

接著看推理深度(effort)。大部分情境用 high 就很夠,不要一上來就調到最高,不夠用再調。

模式的部分,一開始要討論就用規劃模式(Plan Mode),討論完用 Shift+Tab 切回來。我自己預設用 Auto Mode,最大好處是不用每一步都按確認。

最後一個好習慣:先開一個新的 worktree。概念類似版本控制,等於隔離出一塊乾淨的工作區,不會污染你原本跑得好好的程式。

為什麼不做零到一的 demo

很多國外創作者講新模型,都直接用一個從零做起的 app 來展示:做一個生產力工具,要有待辦清單、行事曆,最好還有番茄鐘跟小遊戲。

那種測法有個問題:沒有歷史包袱、沒有舊程式碼,怎麼做都對,改壞了也沒有會痛的壓力。看不出模型真正的能力。而你的工作從來就不是面對一個全新空白的專案,對吧?

所以我拿真的東西考它:我的 AI 影片剪輯生產線。影片丟進去,從語音辨識、自動剪片、字幕、片頭、補充畫面(B-roll)、去贅詞,到縮圖跟上架文案,整套用 Claude Code 搭起來,花了我大概兩個禮拜,現在每一支影片都靠它。我自己打分大概九分,剩下那一分就是今天的考題:retake 的拼接

錄影時講壞一段我會重錄,常常重錄很多次,每次講的字還可能不一樣。系統要負責把正確那一段拼接回去。砍很簡單,接得天衣無縫非常難:不能切在字的中間、前後語句要銜接得自然、音量跟底噪要連續、停頓要像真的。變數多到爆。

就算你不剪片也沒差,把它換成你系統裡那種平常跑得還行、偶爾就給你出包一次的 bug,本質上是同一件事。我把這些壞掉的案例都記錄下來,今天拿它來考 Fable 5。

而且我的標準比「能不能寫程式」還高一截。我的工作流裡有一條鐵律:修問題要修在機制層。出了 bug 不是把症狀蓋掉就好,要找到根因,再加上測試,確保這類問題永遠不會再發生。以前的模型你不盯著,它就很愛給你打發過去,很多時候連程式都不改,只把輸出結果弄對。Fable 5 號稱是一名資深工程師,那我自然用資深工程師的標準看它。

實測完整流程:先讓它問問題到測試全綠才算完的六步驟

實測第一步:先讓它問問題

注意看,我不會叫它直接開工。第一步,我先讓它問我問題。

我把問題講給它聽:影片剪輯在 retake 拼接時會出哪些狀況、壞掉的案例放在哪裡讓它去看。更重要的是跟它說:你先不要動手,用資深工程師的角度,把你需要知道的問題一次問完,包括我漏掉了什麼、哪裡最容易爆,我們把事情釐清再開始。

實際的指令長這樣(路徑換成你自己的):

我的中文影片剪輯 pipeline 在 retake 拼接上有幾個會重現的壞接點,case 我都留下來了,

整理在:(你的案例檔路徑)

(來源專案 edit 資料夾路徑、preview 時碼、症狀描述都在裡面)。

先不要動手。用資深工程師的角度,把你需要知道的問題一次問完:


我漏掉了什麼?哪裡最容易爆?我們把問題弄清楚再開始。

它花了三四分鐘把我給的東西看完,然後開始發問。這裡跟以前的模型差很多:它問得非常細,從資料保護、驗證深度、PR 怎麼拆、案例檔的處理方式,一路問到最後怎麼提交。

它的第一個問題就是我自己沒想清楚的。它自己發現:改完之後重跑影片,會覆蓋掉之前產生的過渡檔、最終檔跟中間產出的 JSON 文件。它問我要不要先複製一份出來保護原始狀態。這件事我原本完全沒想到。

這就是把它當同事而不只是工具的用法:要求它有問題要問、先把事情釐清、確認有沒有我沒考慮到的,都搞清楚再開工。

四要素目標模板

雙方釐清問題之後,我把需求整包丟給它。注意看,這個目標裡我給了它四個東西:

  1. 終點:做完之後長什麼樣子
  2. 驗收標準:怎樣才算通過
  3. 禁區:什麼不能碰(不准用蓋症狀的方式硬修、不准弄壞原本正常的功能、什麼資料不能刪)
  4. 停損:遇到什麼狀況先停下來問我(例如要動到核心假設、或有破壞性操作時)

這就是邊界的設計。我實際下的開工指令長這樣:

好,開始。目標如下,做完、自己驗證、驗過才算結束:

【終點】cases.md 裡的五個壞接點在 preview 中消失,而且修在機制層

(演算法/helper 層級),不是逐條手修。

【驗收標準】

  1. 原本的 pytest 全綠(回歸:其餘 130+ 個好接點一個都不准壞)
  2. 五個壞接點寫成測試案例(從真實 timing 取 fixture),跑起來全綠
  3. 受影響段落重新 render 後,我會親耳 A/B 驗收

【禁區】

  • 不准手動改 EDL 把這五條症狀蓋掉
  • 不准改動原本通過案例的行為
  • 只在這個 worktree 動,不碰 main

【停損】

  • 要動到演算法的核心假設(例如詞邊界 cap、VAD 門檻的語意)時,先停下來問我
  • 任何破壞性操作(刪檔、覆寫來源素材)先停下來問我

指令下下去,我把模式從規劃切成 Auto Mode,接著就是長達三十五分鐘的開發過程。中間我完全放手,它把五個任務一個一個做完。

給 AI 開工前的四要素清單:終點、驗收標準、禁區、停損

驗收分兩層:耳朵+測試

程式改完,驗收分兩層。

第一層是聽感。 五個壞接點修的是聲音的拼接,所以由我當裁判,五個檔案一個一個聽,比對修改前後。例如其中一個案例,原本在「然後有人」的地方跳幀,修完之後接得順了。五個問題我聽下來都解決了。

第二層是程式測試。 切到目錄跑測試,五個被修正的片段全部通過。這次它總共改了兩個 commit,因為有兩個問題,它事前還問我要放同一包解決還是分開,我選分開。要看細節就上 GitHub 看那兩個 pull request,每一包裡面它會寫清楚:什麼問題、改了什麼、做了什麼測試、動了哪些程式。確認沒問題就合併回主程式。

另外我的習慣是還會再下一個指令,讓它把整條 AI 影片剪輯功能從頭到尾跑一次完整測試。因為開頭那條鐵律:改任何功能都不能把原本的功能改壞,這是平常做 AI 寫程式最討厭碰到的事。跑完,原本 130 多個好接點一個都沒壞。

回到驗收卡片:人工聽過了,測試項目也全部通過,全部過關。

這邊帶一個觀念。你會看到我的測試分兩層,一層可以寫程式自動測,另一層需要人介入,用眼睛看介面、用耳朵聽音檔。AI 再怎麼強,方向對不對永遠是人的價值跟人的工作。只是以前你要一個一個下指令盯著,現在模型夠強,你不用再一整天盯著 AI,但值不值得做、什麼樣的成果才算好,判斷是人,這件事外包不掉。

兩個禮拜的免費窗口,挑一個卡很久的問題丟給它

最後回到開頭的期限。Fable 5 現在在 Claude 的 Pro、Max、Team 訂閱方案內含,只到 6 月 22 日。之後要走 API,每百萬詞元輸入 10 美元、輸出 50 美元,是 Opus 的兩倍。

代表你大概有兩個禮拜,可以不多花錢去體驗目前最強的模型。這種等級的模型最適合很長、很大、很複雜的任務,正好拿你以前沒辦法解決的問題、想都不敢想的專案來試。

所以不要只是看完點個讚。這一週挑一個你真正卡很久、本來覺得 AI 做不到的工作:先讓它問你問題,再用上面那份四要素模板給它明確的目標跟驗收標準,然後放手讓它長時間跑。也歡迎留言告訴我你用這個模板跑出了什麼成果。

觀看完整影片


如果你想看我怎麼把整條 AI 生產線搭起來的其他案例,我在 Skool 社群「AI 效率革命聯盟」把所有專案與模板全部公開:70+ 個 AI 自動化模板與專案、5 大核心主題課程、持續更新的進階實戰課,加上不定期直播 AMA 與 Live Build。

👉 加入 AI 效率革命聯盟

還沒準備加入付費社群?我在免費社群「AI 效率啟動營」準備了 AI 公司一天時間表、Multi-Agent 角色設計速查表,以及 5 個 APP 的建置 Prompt(Second Brain、Kanban Dashboard、Mission Control、Content Analytics、Stock Watchlist)含完整設定說明書。

👉 免費加入 AI 效率啟動營

如果你不想錯過更多 AI 自動化與 AI agent 的內容,記得訂閱我的頻道

關於作者

我投資美股,主要方式為超長期價值投資持有股息成長型企業,
並搭配簡易選擇權以合理價之下的價格購入,且將股票出租,每月創造現金流,讓等待的時間也能額外創造被動收入並加速雪球效應產生的速度。
現金流就像我種樹, 只吃果實,也只取我夠吃的果實,而樹枝仍會持續茁壯。

延伸閱讀:

發佈留言

Your email address will not be published. Required fields are marked

{"email":"Email address invalid","url":"Website address invalid","required":"Required field missing"}