Anthropic 放出了 Claude Fable 5 跟 Mythos 5。官方公布的基準測試數據大幅領先自己跟其他對手,文章裡還秀了一段案例:金流公司 Stripe 處理五千萬行程式碼的搬遷,本來要整個團隊花兩三個月,用新模型一天就做完。
但你應該跟我一樣,看到新模型出來已經無感了。官方每次都說基準測試怎樣怎樣,實際用起來的體驗差異卻沒那麼大。所以你心裡一定有個問題:這個新模型到底值不值得花時間跳進去用?
我不細講跑分。我只做一件事:把我每天在用的 YouTube 影片生產流程裡,一個長久以來不好處理的問題,直接丟給 Fable 5 實測。先說結論:它通過了。但過程裡它做了一件我沒要它做的事,幫我把一個我自己沒想到的問題抓出來,那一段比結論更值得看。
文末我會把我給它的那份開發模板直接給你,抄了就能用在你的工作流。而且這件事有期限:Fable 5 免費開放給訂閱用戶只到 6 月 22 日。
Fable 5 到底是什麼
你可能對 Fable 這個名字很陌生。它就是幾個月前傳出來的那個 Mythos:等級跟以往模型完全不同的大語言模型。Mythos 因為太強,只開放給特定族群,像資安開發者、跟美國國防相關的機構。
Fable 5 是 Mythos 開放給一般人用的安全版本。遇到資安攻擊這類安全性問題時,它會退回 Opus 的模型。簡單講:Fable 5 就是神級模型的民用版。
費用的部分先講清楚。現在 Claude 的 Pro、Max、Team 訂閱方案都直接內含 Fable 5,但只到 6 月 22 日。之後要走 API 或用量點數付費,每百萬詞元(token)輸入 10 美元、輸出 50 美元,是 Opus 的兩倍。換句話說,你大概有兩個禮拜可以不多花一毛錢,去試這個到目前為止最強的模型。
最重要的觀念:給目標,不要給步驟
進實測之前,先講這支影片最重要的一個觀念。你只要記住這一點,今天就值得了。
以前用 Claude 或 Cursor 開發,流程通常是:下指令讓 AI 做,人工檢查(或讓 AI 檢查),有問題再叫它改。人卡在中間不斷輸入、不斷循環,像一個主管盯著員工,一步都不敢放。
到了 Fable 5,問題不再是它做得對不對,而是確認它做的是對的事情。你的工作從檢查它的每一步,變成確認它走的方向是你要的。
具體來說,用法有三個改變,這三條是 Anthropic 官方建議的:
- 把它當同事用。 像平常跟同事工作那樣,不斷跟它討論:這個方法你有什麼建議?有沒有更好的切法?
- 給大目標,不給小碎步。 模型已經聰明到你可以直接把第十步要的終點給它,讓它自己找路。但給目標不是丟一句話就好,要帶上你的驗收標準、什麼情況要停下來問人、怎樣才算做完,寫清楚它跑出來的結果才會是你要的。
- 把野心放大。 以前你覺得 AI 做不到的事,現在都值得重新丟一次。
我要補一條官方沒講、我自己試出來的:模型越強,你越要把設計的邊界講清楚。 不要因為它變強了就隨便要求它。你隨便給,它只是更快地把錯的事情做完。怎麼設邊界,下面實測就會看到完整做法。
環境設定
進 Claude 的命令列工具之後,預設選不到這個模型,要自己下 /model claude-fable-5 切過去。
接著看推理深度(effort)。大部分情境用 high 就很夠,不要一上來就調到最高,不夠用再調。
模式的部分,一開始要討論就用規劃模式(Plan Mode),討論完用 Shift+Tab 切回來。我自己預設用 Auto Mode,最大好處是不用每一步都按確認。
最後一個好習慣:先開一個新的 worktree。概念類似版本控制,等於隔離出一塊乾淨的工作區,不會污染你原本跑得好好的程式。
為什麼不做零到一的 demo
很多國外創作者講新模型,都直接用一個從零做起的 app 來展示:做一個生產力工具,要有待辦清單、行事曆,最好還有番茄鐘跟小遊戲。
那種測法有個問題:沒有歷史包袱、沒有舊程式碼,怎麼做都對,改壞了也沒有會痛的壓力。看不出模型真正的能力。而你的工作從來就不是面對一個全新空白的專案,對吧?
所以我拿真的東西考它:我的 AI 影片剪輯生產線。影片丟進去,從語音辨識、自動剪片、字幕、片頭、補充畫面(B-roll)、去贅詞,到縮圖跟上架文案,整套用 Claude Code 搭起來,花了我大概兩個禮拜,現在每一支影片都靠它。我自己打分大概九分,剩下那一分就是今天的考題:retake 的拼接。
錄影時講壞一段我會重錄,常常重錄很多次,每次講的字還可能不一樣。系統要負責把正確那一段拼接回去。砍很簡單,接得天衣無縫非常難:不能切在字的中間、前後語句要銜接得自然、音量跟底噪要連續、停頓要像真的。變數多到爆。
就算你不剪片也沒差,把它換成你系統裡那種平常跑得還行、偶爾就給你出包一次的 bug,本質上是同一件事。我把這些壞掉的案例都記錄下來,今天拿它來考 Fable 5。
而且我的標準比「能不能寫程式」還高一截。我的工作流裡有一條鐵律:修問題要修在機制層。出了 bug 不是把症狀蓋掉就好,要找到根因,再加上測試,確保這類問題永遠不會再發生。以前的模型你不盯著,它就很愛給你打發過去,很多時候連程式都不改,只把輸出結果弄對。Fable 5 號稱是一名資深工程師,那我自然用資深工程師的標準看它。
實測第一步:先讓它問問題
注意看,我不會叫它直接開工。第一步,我先讓它問我問題。
我把問題講給它聽:影片剪輯在 retake 拼接時會出哪些狀況、壞掉的案例放在哪裡讓它去看。更重要的是跟它說:你先不要動手,用資深工程師的角度,把你需要知道的問題一次問完,包括我漏掉了什麼、哪裡最容易爆,我們把事情釐清再開始。
實際的指令長這樣(路徑換成你自己的):
我的中文影片剪輯 pipeline 在 retake 拼接上有幾個會重現的壞接點,case 我都留下來了,
整理在:(你的案例檔路徑)
(來源專案 edit 資料夾路徑、preview 時碼、症狀描述都在裡面)。
先不要動手。用資深工程師的角度,把你需要知道的問題一次問完:
我漏掉了什麼?哪裡最容易爆?我們把問題弄清楚再開始。
它花了三四分鐘把我給的東西看完,然後開始發問。這裡跟以前的模型差很多:它問得非常細,從資料保護、驗證深度、PR 怎麼拆、案例檔的處理方式,一路問到最後怎麼提交。
它的第一個問題就是我自己沒想清楚的。它自己發現:改完之後重跑影片,會覆蓋掉之前產生的過渡檔、最終檔跟中間產出的 JSON 文件。它問我要不要先複製一份出來保護原始狀態。這件事我原本完全沒想到。
這就是把它當同事而不只是工具的用法:要求它有問題要問、先把事情釐清、確認有沒有我沒考慮到的,都搞清楚再開工。
四要素目標模板
雙方釐清問題之後,我把需求整包丟給它。注意看,這個目標裡我給了它四個東西:
- 終點:做完之後長什麼樣子
- 驗收標準:怎樣才算通過
- 禁區:什麼不能碰(不准用蓋症狀的方式硬修、不准弄壞原本正常的功能、什麼資料不能刪)
- 停損:遇到什麼狀況先停下來問我(例如要動到核心假設、或有破壞性操作時)
這就是邊界的設計。我實際下的開工指令長這樣:
好,開始。目標如下,做完、自己驗證、驗過才算結束:
【終點】cases.md 裡的五個壞接點在 preview 中消失,而且修在機制層
(演算法/helper 層級),不是逐條手修。
【驗收標準】
- 原本的 pytest 全綠(回歸:其餘 130+ 個好接點一個都不准壞)
- 五個壞接點寫成測試案例(從真實 timing 取 fixture),跑起來全綠
- 受影響段落重新 render 後,我會親耳 A/B 驗收
【禁區】
- 不准手動改 EDL 把這五條症狀蓋掉
- 不准改動原本通過案例的行為
- 只在這個 worktree 動,不碰 main
【停損】
- 要動到演算法的核心假設(例如詞邊界 cap、VAD 門檻的語意)時,先停下來問我
- 任何破壞性操作(刪檔、覆寫來源素材)先停下來問我
指令下下去,我把模式從規劃切成 Auto Mode,接著就是長達三十五分鐘的開發過程。中間我完全放手,它把五個任務一個一個做完。
驗收分兩層:耳朵+測試
程式改完,驗收分兩層。
第一層是聽感。 五個壞接點修的是聲音的拼接,所以由我當裁判,五個檔案一個一個聽,比對修改前後。例如其中一個案例,原本在「然後有人」的地方跳幀,修完之後接得順了。五個問題我聽下來都解決了。
第二層是程式測試。 切到目錄跑測試,五個被修正的片段全部通過。這次它總共改了兩個 commit,因為有兩個問題,它事前還問我要放同一包解決還是分開,我選分開。要看細節就上 GitHub 看那兩個 pull request,每一包裡面它會寫清楚:什麼問題、改了什麼、做了什麼測試、動了哪些程式。確認沒問題就合併回主程式。
另外我的習慣是還會再下一個指令,讓它把整條 AI 影片剪輯功能從頭到尾跑一次完整測試。因為開頭那條鐵律:改任何功能都不能把原本的功能改壞,這是平常做 AI 寫程式最討厭碰到的事。跑完,原本 130 多個好接點一個都沒壞。
回到驗收卡片:人工聽過了,測試項目也全部通過,全部過關。
這邊帶一個觀念。你會看到我的測試分兩層,一層可以寫程式自動測,另一層需要人介入,用眼睛看介面、用耳朵聽音檔。AI 再怎麼強,方向對不對永遠是人的價值跟人的工作。只是以前你要一個一個下指令盯著,現在模型夠強,你不用再一整天盯著 AI,但值不值得做、什麼樣的成果才算好,判斷是人,這件事外包不掉。
兩個禮拜的免費窗口,挑一個卡很久的問題丟給它
最後回到開頭的期限。Fable 5 現在在 Claude 的 Pro、Max、Team 訂閱方案內含,只到 6 月 22 日。之後要走 API,每百萬詞元輸入 10 美元、輸出 50 美元,是 Opus 的兩倍。
代表你大概有兩個禮拜,可以不多花錢去體驗目前最強的模型。這種等級的模型最適合很長、很大、很複雜的任務,正好拿你以前沒辦法解決的問題、想都不敢想的專案來試。
所以不要只是看完點個讚。這一週挑一個你真正卡很久、本來覺得 AI 做不到的工作:先讓它問你問題,再用上面那份四要素模板給它明確的目標跟驗收標準,然後放手讓它長時間跑。也歡迎留言告訴我你用這個模板跑出了什麼成果。
觀看完整影片
如果你想看我怎麼把整條 AI 生產線搭起來的其他案例,我在 Skool 社群「AI 效率革命聯盟」把所有專案與模板全部公開:70+ 個 AI 自動化模板與專案、5 大核心主題課程、持續更新的進階實戰課,加上不定期直播 AMA 與 Live Build。
還沒準備加入付費社群?我在免費社群「AI 效率啟動營」準備了 AI 公司一天時間表、Multi-Agent 角色設計速查表,以及 5 個 APP 的建置 Prompt(Second Brain、Kanban Dashboard、Mission Control、Content Analytics、Stock Watchlist)含完整設定說明書。
如果你不想錯過更多 AI 自動化與 AI agent 的內容,記得訂閱我的頻道。


