零 API 費用!本地端 AI 動畫影片全流程教學

想做 AI 動畫影片,最快的方式當然是訂閱 Runway、Pika 或各家雲端服務,但只要產量一拉高,帳單也會跟著失控——按秒計費的影片生成,很容易一個月燒掉數萬元。這篇教學的目標,是幫你搭出一套完全在自己電腦上運行、不需要支付任何雲端 API 費用的 AI 動畫製作流水線,從硬體選購、ComfyUI 節點配置,一路講到角色一致性、動作控制、畫質升頻與最終剪輯,每一個環節都用開源、可本地執行的工具取代付費雲端服務。
為什麼不能只靠「一鍵生成」
市面上大多數 AI 影片工具主打「輸入文字、按下按鈕、等影片跑出來」,但這種模式做短短幾秒的素材片段沒問題,一旦你想做的是有固定角色、連貫劇情、超過 10 秒的內容,「一鍵生成」幾乎必然崩潰:角色長相每次都不一樣、動作亂飄、鏡頭語言不受控。要做出真正「可控」的作品,必須放棄單一工具的幻想,改用節點式工作流(Node-based Workflow),把整個製作過程拆成「資產建立 → 動作引導 → 渲染生成 → 後製合成」四個階段,每個階段各司其職,才有辦法疊出穩定、可重現的品質。
硬體門檻:VRAM 決定一切
本地跑 AI 影片,顯示卡的 VRAM(顯示記憶體) 是唯一真正卡關的規格,它決定了你能載入多大的模型、跑多高的解析度、疊多少張 ControlNet 與 LoRA。以下是實務上建議的最低配置:
| 元件 | 建議規格 | 為什麼重要 |
|---|---|---|
| GPU(關鍵) | NVIDIA RTX 3090 / 4090(24GB VRAM) | 24GB 是同時載入影片生成模型與多個控制節點的實務門檻;部分輕量流程可壓到 12GB,但功能會被限縮 |
| 系統記憶體 | 64GB DDR5 | 載入大型模型檔、處理連續影格時極易吃滿記憶體 |
| 儲存空間 | 2TB 以上 M.2 NVMe(PCIe 4.0) | 每個模型/LoRA 動輒 2GB~10GB,加上生成過程的中間影格會占用大量空間 |
| CPU | Intel i7/i9(13/14 代)或 AMD Ryzen 7000 系列以上 | 負責剪輯軟體渲染、音訊處理與資料前處理 |
如果預算有限,24GB VRAM 的顯卡是最值得優先投資的單一項目——即使其他規格打折扣,VRAM 不夠,很多模型直接載入失敗,沒有商量餘地。
核心軟體環境:以 ComfyUI 為調度中心
比起傳統的 WebUI,ComfyUI 更適合作為整條流水線的運算調度中心,因為它用節點圖的方式把每個步驟都視覺化、可拆解、可重複使用,也更方便串接不同模型與後製工具。
底層環境部署:
- 安裝 Python 3.10 以上版本與 Git。
- 安裝對應顯卡的 CUDA 驅動與 PyTorch。
- 安裝 ComfyUI,並搭配 ComfyUI-Manager 擴充套件——它能幫你自動偵測、安裝並管理下面提到的所有自訂節點,省去手動處理相依套件的麻煩。
必裝的核心擴充節點:
- 原生影片生成模型(取代舊式 AnimateDiff 動態模組):以 Wan2.2(阿里巴巴通義團隊開源)作為主力影片生成模型,這是目前 ComfyUI 生態中最泛用的開源影片模型之一,同時支援文字轉影片、圖片轉影片與影片編輯;也可視風格需求搭配 HunyuanVideo(騰訊)或 LTXVideo 作為替代選項。這幾個模型都是直接生成連續影格的「原生影片模型」,畫面連貫性通常優於早期靠 AnimateDiff 動態模組疊加在靜態圖像模型上的做法。
- ComfyUI-AnimateDiff-Evolved:如果你的顯卡 VRAM 較吃緊(8GB 左右),或想做的是偏插畫、風格化的短動畫,AnimateDiff 仍然是輕量、生態成熟的選項,社群累積了大量現成工作流可以直接套用,只是動作連貫性與畫質天花板不如原生影片模型。
- ComfyUI_IPAdapter_plus:用於角色臉部與整體風格的一致性保持,不必每個鏡頭都重新訓練角色。
- ComfyUI-Advanced-ControlNet:載入 OpenPose(姿態骨架)、Depth(深度圖)與 Lineart(線稿)等控制條件,精準約束人物動作與鏡頭運鏡,避免動作亂飄。
- ComfyUI-Frame-Interpolation:內建 RIFE、FILM 等補幀演算法,把生成時偏低的幀率(例如 8fps)平滑升頻到 24fps 甚至 60fps 的電影幀率。
- SUPIR / Ultimate SD Upscale:影像高畫質升頻節點,用來把初始生成的 512p~720p 畫面放大到更高解析度,同時補齊皮膚質感與畫面細節。
四階段生產流程
一部完整的 AI 動畫短片,建議拆成以下四個階段依序處理,而不是想著一次生成到位:
[階段一:資產建立] → [階段二:動作引導] → [階段三:渲染生成] → [階段四:後製合成]
角色 LoRA 訓練 3D 骨架與鏡頭軌跡 ControlNet + 升頻 配音、配樂、剪輯調色
階段一:角色與美術風格資產化
角色一致性是整條流程裡最容易翻車,也最值得花時間打磨的環節。實務作法是先繪製角色設定圖(正面、側面、多種表情),再依你要生成的內容類型,選擇對應的訓練工具:
- 如果你的關鍵幀是用 SDXL 或 Flux 這類靜態圖像模型畫出來的,用 Kohya_ss(sd-scripts) 訓練專屬的角色 LoRA,這是圖像模型 LoRA 訓練最成熟、社群資源最多的工具。
- 如果你要直接訓練影片模型本身(例如 Wan2.2、HunyuanVideo)的角色 LoRA,該用的是同一位作者(kohya-ss)另外開發的 musubi-tuner,這是專門針對影片擴散模型設計的訓練框架;官方文件建議影片模型訓練至少要有 24GB VRAM(僅訓練靜態圖像模型時 12GB 即可)——這兩個工具雖然同一個作者、名字也相近,但用途與硬體門檻都不同,別搞混。
場景與整體美術風格,則另外用一顆風格 LoRA 疊加在底模上(例如賽博龐克、手繪吉卜力風),與角色 LoRA 分開訓練、分開管理,方便日後替換美術風格而不動到角色本身。
階段二:分鏡與動作引導
AI 影片最常見的失敗模式就是「動作亂飄」——人物走位、鏡頭運動完全不受控制。解法是用傳統 3D 工具先把動作「定」下來,再交給 AI 上色:
- 在 Blender 或 MMD 裡架設簡單的 3D 人偶骨架,規劃好角色動作與鏡頭運鏡軌跡。
- 從 3D 場景匯出 OpenPose 骨架序列或 Depth 深度圖序列影片。
- 把這段序列影片餵進 ComfyUI 的 ControlNet 節點,強制 AI 依照指定的骨架動作與鏡頭軌跡逐格繪製,而不是自由發揮。
這一步看似麻煩,但它是「電影感」與「隨機亂晃」之間最大的分野——所有能穩定輸出角色動畫的工作流,幾乎都繞不開這道 3D 引導的步驟。
階段三:ComfyUI 渲染與升頻
有了角色 LoRA 與動作引導素材後,正式進入生成階段:
- 關鍵幀生成:用角色 LoRA + IPAdapter 生成高畫質的關鍵幀圖片,確定每個鏡頭的構圖與角色狀態。
- 動態渲染:透過 Wan2.2(或 HunyuanVideo/LTXVideo)搭配 ControlNet 進行連續影格渲染;VRAM 較吃緊時,也可退而求其次改用 AnimateDiff 疊加在關鍵幀上做動態延伸。
- 空間升頻:用 SUPIR 節點把生成的 512p~720p 畫面放大到更高解析度,自動補齊皮膚質感與畫面細節。
- 時間升頻:用 RIFE 節點做動態補幀,把偏低的生成幀率平滑到接近電影標準的幀率,消除卡頓感。
階段四:配音、配樂與剪輯後製——全程零 API 費用
這是最容易不小心「破功」的階段——很多教學到這裡會建議用 Suno、Udio 這類雲端配樂服務,或商用語音克隆 API,但這些都是按用量計費的雲端服務,跟「本地、零花費」的目標直接衝突。要維持全流程零 API 成本,這兩塊都有現成的本地開源替代方案:
- 配音:用 GPT-SoVITS(MIT 授權、完全開源)在本機訓練角色專屬語音——只要幾十秒到一分鐘的參考錄音,就能做出品質不錯的聲音克隆,支援中、英、日、韓、粵語等多語言互轉;社群也維護了對應的 ComfyUI 整合節點,可以直接接進你原本的工作流裡。
- 配樂:用 ACE-Step 取代 Suno/Udio——這是一套開源本地音樂生成模型,官方測試在消費級顯卡(如 RTX 3090)上生成一首完整歌曲只需幾秒到十幾秒,甚至能在 4GB VRAM 左右的入門顯卡上運行,社群也做了對應的圖形化介面(如 ACE-Step UI),操作體驗接近 Suno,但完全跑在自己電腦上、沒有訂閱費或按次計費。
- 剪輯與調色:用 DaVinci Resolve 免費版做最終的非線性剪輯、鏡頭轉場、音軌混音與 LUT 調色——免費版功能已經足以應付大多數個人與小型專案的後製需求,不需要额外付費升級。
開發建議:先做 5 秒 Pilot,再談長片
第一次搭這套環境,千萬別一開始就挑戰做完整短片。務實的做法是先調通一組「1 個角色、1 個明確動作、5 秒長度」的最小工作流,確認角色一致性、動作控制、音畫同步這幾個環節都跑得通,再逐步疊加鏡頭數量與時長。
另外,ComfyUI 支援把工作流存成 .json 檔,並提供本機 API 供程式呼叫——這裡的「API」指的是你自己電腦上的本地服務端口,不是要花錢的雲端服務,完全不影響零成本這個前提。你可以寫一支 Python 腳本,把分鏡腳本批次餵進去,讓電腦在晚上自動跑完一整批鏡頭的渲染,隔天早上直接進剪輯階段——這也是本地化流程相對雲端服務最大的優勢:硬體是一次性投資,之後生成再多素材,也不會再多花一毛錢。



