如何製作 AI 偽紀錄片短片

閱讀約 12 分鐘

偽紀錄片適合 AI 製片,因為訪談、直接切鏡、手持構圖與短輔助畫面可以拆成獨立單元製作。我做初剪的原則是,每個鏡頭都必須呈現角色、推進故事或遮住剪接點。如果三者都做不到,我就不把它列入生成清單。

為什麼偽紀錄片適合模組化 AI 流程?

多數 AI 影片形式都容不得失誤。緩慢的電影鏡頭晃動、臉孔在影格之間逐漸走樣、動作中途光線改變,在精緻劇情片或動作場景中,這些都會破壞真實的幻覺。

偽紀錄片正好相反。每個「缺陷」都有合理的解釋:

  • 手持晃動的構圖看起來像真實紀錄片畫面,而不是 AI 瑕疵
  • 硬切能隱藏不完美的轉場,你完全不必把片段之間的接縫修得平滑
  • 訪談鏡頭不需要電影級運鏡,只要一張臉與連貫的表情
  • 短片段控制成本低,出錯時重新生成的成本也低

這種形式建立在一個邏輯上:原始、略有瑕疵的畫面,比精雕細琢的畫面更可信。而 AI 影片生成恰好能產出這樣的畫面。

你唯一需要控制的,是角色一致性和剪輯。其餘一切,這種形式都會替你處理。

生成前先規劃

開啟 DomoAI 前,先寫 5–8 個訪談節點。每個節點用一句話描述角色在某場景說了什麼或做了什麼:

  • 「Maya 堅稱這件事與她無關。」
  • 「Robert 慢慢解釋公司的政策。」
  • 「事件畫面,由未出鏡的聲音旁白。」

這些敘事節點就是你的影片。你不需要完整劇本,只要足以了解角色是誰、他們的觀點,以及故事展開的順序。

這些節點會成為訪談片段清單與輔助畫面檢查表。沒有節點的角色不必生成;沒有節點的場景也不必存在。

先寫節點。計畫內的角色才生成;不在計畫內的角色就不要放進 Assets 面板。這條界線能控制片段數量,避免剪輯工作變成翻找素材庫。

敘事節點也會揭露你尚未建立的結構。如果所有節點都屬於同一個角色,那就是獨白,不是偽紀錄片。如果有五個角色和十二個節點,你就遇到製作上的難題了。

少量角色與簡短節點清單讓專案容易檢查。依可用時間及生成預算安排訪談片段、反應穿插鏡頭與輔助畫面。

步驟 1:先固定角色陣容

角色一致性,是決定偽紀錄片成敗的唯一關鍵變數。做任何其他事之前,先生成你的角色陣容;參考圖片一旦確定,就絕不要偏離。

如何使用 Nano Banana Pro 建立固定角色:

  • 最多上傳 9 張參考圖片。有真實照片就用它;如果從零生成,先做 3–4 個版本,再挑最一致的臉孔。
  • 生成提示詞範例:「紀錄片受訪者,三十歲出頭,略顯凌亂的商務休閒裝,自然室內光,中景,表情略帶疲倦,寫實」
  • 生成三個角度:正面肖像、中景,以及略微的 3/4 轉身。將三張都儲存到 Assets 面板。
  • 為每個重複出現的角色重複此步驟。兩三名「受訪者」已足以構成有說服力的偽紀錄片。

哪些因素會破壞角色一致性?

極端的臉部角度會破壞一致性。從正面參考圖生成角色的完全側面時,外觀會漂移,因為模型必須從零想像那個角度。請讓角色角度與參考圖的差距保持在 30 度以內。

服裝變化會打破連貫性。如果角色上一場穿西裝,下一場穿 T 恤,卻沒有敘事上的解釋,看起來會像不同的人。固定參考圖中的服裝,除非故事需要,否則維持一致。

多數偽紀錄短片適合使用兩到三個反覆出現的角色。一個角色是獨白;四個或更多角色則會變得難以管理。

Character to Video 能在保留外觀的同時,讓已固定的角色做出新的動作。讓片段之間的光線與構圖保持一致,每個場景才會像來自同一次拍攝。

為角色保留視覺規範

我會為每個常駐角色記一列資料。這比在每條動作提示詞都貼上完整角色描述更有用。

固定項目一次記錄每支片段都檢查
臉部確認好的肖像與表情範圍眼睛、下顎、髮際線
服裝顏色、剪裁、配件遺漏或被替換的細節
道具代表物件與持握的手比例與身體哪一側
地點背景底圖與光線方向窗戶、場景燈、地平線
裁切訪談、中景或全身符合場景預定用途
聲音說話者檔案、節奏、情緒沒有畫面也能辨認角色

AI 分鏡指南 能協助把節點表轉成所需鏡頭。群像參考可研究 三角色情境喜劇場景;更廣泛的敘事靈感可瀏覽 故事影片合集

步驟 2:製作人物訪談鏡頭

人物訪談是偽紀錄片的骨幹。它們承載故事、傳達笑點,也提供可切到其他畫面的基礎。先生成這些鏡頭。

使用 Talking Avatar:上傳已固定的角色圖片與音訊。標準方案的時長選項為 5、10、20 秒;Pro 可使用 30、60 秒片段。撰寫簡短的訪談回答,而不是獨白;每段 10–15 秒的語音,剪接起來很自然。

先在 Text to Speech 生成聲音。像 [Cheerful] 這類情緒標籤,適用於 TTS 腳本。接著把音訊送入 Talking Avatar,並用獨立的動作/表情提示來控制微笑、點頭、視線和手勢。

  • [Neutral] —— 平靜、從容的回答
  • [Sad] —— 坦白時刻或不情願的承認
  • [Surprised] —— 揭露或反應節點
  • [Angry] —— 逐漸升溫的爭論

表情與動作提示詞(與台詞分開輸入):

  • 「略帶緊張的微笑,短暫瞥向鏡頭外,在座位上挪動」
  • 「雙臂交叉,懷疑表情,挑起一邊眉毛」
  • 「稍微前傾,專注,慢慢點頭」
  • 「低頭再抬頭,回答前有一段不自在的停頓」
  • 「自信,直接看鏡頭,雙手交握,下巴略抬」
  • "trail off mid-thought, eyes move to corner, recover with a tight smile"

用 TTS 速度塑造角色:複製聲音的速度控制範圍為 0.5x 至 2.0x。稍慢的語速(0.85x)會讓角色聽起來更深思熟慮,呈現坦白或謹慎的感覺。稍快的語速(1.1x)則聽起來緊張或閃躲。把速度當作角色特徵,而不只是節奏調整。

只為重要台詞生成替代鏡次。Talking Avatar 以 Fast Mode 運作,因此重新生成會消耗點數。

步驟 3:生成輔助畫面與穿插鏡頭

輔助畫面打破連續訪談鏡頭,並增添世界的質感。在真正的紀錄片中,輔助畫面用來遮蓋剪接點並延展場景。在這裡,它也能隱藏片段之間的一致性缺口。

1. 建立場景鏡頭:對生成的靜態圖片使用 Image to Video(Seedance 2.0)。提示詞:"empty office hallway, fluorescent lights, late afternoon, slightly desaturated, handheld look"

2. 反應穿插鏡頭:拍攝主體看向畫面外,沒有音訊,只有表情。Talking Avatar 的純表情提示詞:"subject watches something out of frame, slight discomfort, handheld medium shot"

3. 物品與細節插入鏡頭:生成靜態圖後再製作動畫。提示詞:「凌亂桌上的一疊紙,旁邊散放一支筆,紀錄片特寫,自然窗光,鏡頭輕微漂移」

4. 移動中的主體:使用 Character to Video 並搭配走路參考片段。指示:「人物沿走廊背對鏡頭走遠,手持跟拍,略微不穩」

5. 檔案/拾獲影像風格片段:生成帶有濃重膠片顆粒、褪色色彩和略不穩定構圖的短片段。這些插入畫面能增添世界的深度,暗示當前事件之外的歷史。提示詞:"16mm film look, heavy grain, slight colour fade, institutional office hallway, 1990s, unsteady handheld"

6. 對鏡頭自白(非正式訪談):角色不是坐在正式訪談椅上,而是被攝影機拍個措手不及。Talking Avatar 提示詞:"caught mid-task, slightly startled by camera, recovers to direct address, documentary veríté"

在 DomoAI 2.4.1 中,Frames to Video 支援 2–8 張關鍵影格,以及 1–56 秒的多影格生成。Seedance 2.0 的 Frames to Video 則使用起始影格加結束影格,時長遵循 Seedance 的 4–15 秒範圍。

步驟 4:保持短片段,在編輯器組成影片

影片存在於你的時間軸,而不是任何單一片段中。一個不理想的 3 秒穿插鏡頭,幾乎不花什麼成本就能重新生成;一個冗長的 45 秒訪談片段,卻很難修好。

各類片段的目標長度:

  • 訪談回答:5–20 秒
  • 反應穿插鏡頭:3–8 秒
  • 建立場景鏡頭:5–10 秒
  • 細節插入鏡頭:2–5 秒

使用 CapCut、Premiere Pro 或 DaVinci Resolve 剪輯。在說話時切,不要等到沉默才切。偽紀錄片的節奏短促,帶點焦躁;感覺早了一拍的剪接,通常才是對的。

步驟 5:在編輯器加入紀錄片質感

後製會大幅影響各片段是否像同一部影片。讓下三分之一字幕條、字幕樣式、環境底噪、顆粒與色彩處理在整個序列保持一致。

下三分之一姓名條:白色文字、無襯線字體、左下角。標籤:「姓名,職稱」。光是這個元素,就能把任何對鏡頭說話的畫面變成訪談。CapCut 內建下三分之一字幕模板;在 Premiere Pro 中,請使用 Essential Graphics 面板。

字幕與對白字幕:在 CapCut 或 Premiere Pro 依音訊自動生成。即使是明顯虛構的偽紀錄片,字幕也有幫助:它能留住觀眾,也增添紀錄片的視覺語法。

旁白:使用 Text to Speech 生成。選 Neutral 或略帶疲倦的聲音。放在輔助畫面與建立場景鏡頭下方,不要蓋過訪談片段。旁白保持簡短,每次場景銜接一兩句即可。

調色:將飽和度降低約 20%,加入輕微的膠片顆粒,再加上一點暗角。這個組合立刻就會讓人聯想到「檔案影像」或「真實」。不要跳過。

音樂與環境底噪:在剪輯下方鋪上低音量的持續環境音或簡約配樂。Suno 很適合生成短小、方便循環的音樂。剪接點之間的空間底噪,能填補讓拼接片段顯得斷裂的沉默;即使只有 0.5 秒的環境聲,也能讓硬切更流暢。

我會規劃的 30 秒冷開場

時間鏡頭敘事作用
0–4s固定訪談:「是印表機發起這場會議的。」提出荒謬前提
4–7s手持印表機特寫提供視覺證據
7–13s第二名員工否認責任製造衝突
13–18s監視器風格的走廊插入鏡頭遮住訪談轉場
18–25s主管展示一疊印好的要求升高笑點
25–30s無聲反應,接標題卡讓笑點落地

這只是一個節奏範例,不是通用時長規則。如果臉部漂移,我會重新生成訪談鏡頭;笑點太晚,我會剪輯;文字或標誌有誤,我會在生成影片外修正;轉場突兀,我會接受直接切鏡,或用 Frames to Video 規劃。

關於鏡頭選擇,動作控制指南 能協助區分刻意的手持動感與意外漂移。當短片擴展成多場景時,製片人工作流程頁面 是更完整的下一步。

剪輯最終版本

訪談與輔助畫面的平衡:使用足夠的訪談承載故事;當反應、矛盾、場景細節或視覺笑話能增加資訊時,再切到其他畫面。依清晰度與節奏判斷平衡,不要依固定百分比。

如果剪輯卡住,先檢查比例,再改其他任何東西。

場景長度:資訊或情緒節點改變時切鏡。反應、地點細節或形成反差的輔助畫面,可以重新吸引注意力,不必強迫每個場景一樣長。

訪談段落的三段法則:訪談段落通常有三部分。第一個片段表明立場,第二個提供證據或矛盾,第三個呈現反應或後果。以三段為單位建立訪談,即使劇本很精簡,故事也會顯得有結構。

片名卡放在哪裡:第一次訪談前,先以 10–15 秒的輔助畫面或建立場景鏡頭開場。在這段建立場景畫面的第 8–12 秒放入片名卡;觀眾此時已有足夠脈絡,會把片名理解為對眼前畫面的確認。

AI 偽紀錄片通常在哪裡剪壞:最常見的失敗模式,是同一個角色的訪談片段連續太多。某個主體連續三個片段都沒有穿插鏡頭,看起來就是獨白,而不是訪談。

每隔第二或第三個訪談片段,就插入反應鏡頭、輔助畫面,或切到另一個角色。穿插鏡頭不必很長。三秒的紙堆或走廊,就能重置節奏,為下一個訪談片段帶來新的推進力。

常見問題

DomoAI 可以一次生成整部影片嗎? 不能,而這正是刻意的設計。長時間的單一片段更難控制,也更容易漂移。你是透過拼接短小、受控的片段來建立影片。與一次生成長片相比,這能讓你更精確地控制表演、節奏和角色一致性。

如何讓角色跨場景保持一致? 開始生成任何內容前,先在 Assets 固定角色參考。該角色的每個片段,都應參照同一張已儲存圖片。Nano Banana Pro 讓你上傳最多 9 張參考圖片,建立穩定的角色身分;以正面、中景和 3/4 角度版本作為基礎。

怎樣讓 AI 偽紀錄片看起來真實? 三件事:一致的角色、正確的紀錄片構圖(訪談鏡頭、手持輔助畫面、下三分之一字幕),以及帶有輕微顆粒的低飽和度調色。破壞沉浸感的,是場景之間變化的臉孔,或缺乏共同視覺語言的片段。

為什麼長片段看起來比短片段差? AI 影片生成的漂移會隨時間累積。比起 10 秒片段,30 秒片段有更多機會出現臉孔細微改變、動作出錯或光線變化。短片段讓你掌握控制權,再透過剪輯拼成需要的長度。

製作一部完成的偽紀錄片短片需要多久? 製作時間取決於角色數、片段數、重試次數與剪輯。請分別為固定角色、生成訪談與輔助畫面,以及完成聲音與時間軸安排時間。

完成的 AI 偽紀錄片應該多長? 沒有普遍適用的理想長度。先從能完整說完故事的最短版本開始,只在新場景能帶來新的敘事節點、反應或證據時才加入。

需要寫完整劇本嗎? 不需要。寫下 5–8 個訪談節點,每個一句話,再列出粗略的輔助畫面清單。每段訪談的實際腳本,可以在 TTS 中逐步發展:寫 2–3 句回答,生成後看看是否合適。敘事節點比劇本更重要。

需要付費方案嗎? 你可以先用免費方案測試角色生成和短片段。較長的 Talking Avatar 片段(30 秒和 60 秒)與較大的生成量,需要付費方案,年繳時每月 $6.99 起。

先使用 DomoAI 的限量免費試用,再於生成較長影片前確認目前的方案限制。

最新文章