第一步不是打開工具,是把那件懶得做的事拆成一條每步都有輸入輸出的步驟鏈
我想把剪片、發文、整理逐字稿交給 AI 自動跑,第一步該做什麼?
2026 Aug 30 Vibe Coding Fixer
「路老闆,我每週要剪片、上字幕、整理逐字稿、發文,這些事情能不能全部交給 AI 自動跑?第一步該做什麼?」
第一步不是打開任何工具。第一步是把那件你懶得做的事,拆成一條步驟鏈,寫在紙上。
每一步寫清楚:進去的是什麼、出來的是什麼。寫得出來,AI 就跑得動;寫不出來,再強的模型也只是在幫你猜。
我用自己做短影音的流程當例子。
我懶得做的事
我不想手動剪片。理想的狀態是:事先寫好腳本,對著手機或麥克風錄音,把聲音檔丟進去,出來就是剪好的畫面加字幕。
聽起來很像魔法,但拆開來其實是幾個很普通的步驟接在一起。
拆成步驟鏈
我的鏈是這樣:
一、聲音檔進去,逐字稿加每一句的時間戳出來。這一步用 Whisper(語音轉文字工具),本機跑或用 API 都行。
二、逐字稿進去,每一句對應的畫面素材出來。事先準備一個 B-roll 素材庫(B-roll 就是配在旁白底下的畫面),檔名用關鍵字命名,例如「電腦工作」「咖啡廳」「台北街景」。這一步讓 Claude 讀每句話的語意,從素材庫挑最接近的。
三、素材跟時間戳進去,裁好長度的片段出來。用 ffmpeg(處理影音的命令列工具)把每段素材裁成對應那句話的長度。
四、片段進去,合併加上聲音、燒入字幕、輸出直式影片。還是 ffmpeg。
四步,每一步的輸入跟輸出都是明確的檔案。然後我請 Claude Code 把這四步寫成一支可以直接執行的腳本,之後每次只要把聲音檔丟進去、跑一次。
為什麼要先拆,不要先問 AI
如果你一開始就跟 AI 說「幫我做一個自動剪片的東西」,它會給你一個很大的東西,然後你不知道從哪裡壞的。
拆成步驟鏈之後,每一步可以單獨測。逐字稿不對就修第一步,配錯畫面就修第二步,其他步不用動。這才是自動化能維護的原因。
還有一個原則:每一步能用決定性的工具做的,就不要交給 AI。轉文字、裁片段、合併、燒字幕,這些工具每次跑結果都一樣,交給它們。只有「這句話該配什麼畫面」這種需要判斷的,才給 AI。判斷的地方越少,整條鏈越穩。
把這套方法套到你的雜事上
你想自動化的可能不是剪片,可能是把 Podcast 逐字稿整理成文章、把一篇長文拆成社群貼文、把每週的資料整理成報表。方法一樣:
- 寫下起點是什麼檔案、終點是什麼檔案
- 中間拆成三到五步,每步一個輸入、一個輸出
- 標出哪幾步是工具能決定性完成的,哪幾步需要判斷
- 先手動跑一遍整條鏈,確認每一步的輸出你都滿意
- 再請 AI 把它寫成腳本
手動跑一遍這一步不要省。你手動走不通的流程,自動化之後只會更快走不通。
順帶講幾個我踩過的小地方:聲音檔先降噪再丟進去,逐字稿會準很多;素材的解析度盡量統一,不然合併的時候要多處理一層;素材數量比句子少的時候,要先決定可以重複用還是要補素材,這種事先想好,腳本才寫得出來。
寫腳本那一段,開最強的模型
這裡有一個配置的細節。跟 AI 討論流程怎麼拆,用輕一點的模型就好,來回快;真的要它寫腳本、處理檔案路徑跟錯誤情況的時候,換成最強的模型,讓它把邊角案例想進去。
因為寫程式是有對錯的事。素材數量比句子少怎麼辦、檔名有空格怎麼辦、聲音檔格式不對怎麼辦,這些它想到越多,你之後半夜被叫起來的次數越少。
常見的誤區:一開始就想做到全自動
很多人第一版就想要「丟進去、什麼都不用管、成品直接發出去」。
不建議。第一版先做到「丟進去、出來一個我看一眼就能用的東西」。發文那一步先留給自己,等你看了幾十次都沒改過,再把它接上去。
自動化是一步一步把人拿掉,不是一開始就沒有人。
留一個問題給你
你那件懶得做的事,現在能不能寫出它的四個步驟,每一步進去什麼、出來什麼?
寫得出來,你已經完成第一步了。
如果你拆到一半卡住,可以把狀況寫信給我。我的電子報每週會寫這類用 AI 把雜事自動化的實際流程,可以先訂起來:https://iamlouis.ai/subscribe/edm
ABOUT ME

路老闆 Louis
路老闆有限公司創辦人、Compassio 個人品牌一站式網站系統的開發者。二十年網站與行銷實戰經驗,長期陪伴講師、顧問與創作者把專業變成品牌。每週透過電子報與 Podcast《路老闆的個人品牌診療室》,分享個人品牌、網站經營與 AI 行銷的實務觀察。
如想留言評分,請先 登入會員!