撰寫能同時生成「影片」與「語音/音效」的指令時,關鍵在於描述視覺細節的同時,也要具體描述聲音的特質(音色、情緒、環境背景聲)。
目前的模型(如 Veo 3.1)非常依賴這種「視聽雙棲」的描述方式。以下為您準備了三種不同情境的示範,您可以直接複製修改:
1. 虛擬人演講(適用於 YouTube 頻道或簡報)
這類指令著重於說話者的神態與聲音的穩定度。
- 指令示範(繁體中文):
- 「一位專業的 30 歲女性科技部落客,面對鏡頭,背景是充滿未來感的居家辦公室。她對著鏡頭微笑並分享 AI 的未來。語音要求:語氣親切且充滿活力,發音清晰,帶有輕微的現代背景電子背景音樂。」
- 指令示範(英文):
- "A professional female tech blogger in her 30s, speaking directly to the camera in a futuristic home office. Audio: Energetic and friendly voice, crystal clear narration, with soft upbeat Lo-fi background music."
2. 電影感場景(適用於短片創作、氛圍營造)
這類指令著重於環境音與視覺節奏的配合。
- 指令示範(繁體中文):
- 「一場雨後的台北街頭,霓虹燈倒映在水窪中,路人撐傘走過。語音要求:細膩的雨聲滴落在傘面的聲音,遠處隱約的車流鳴笛聲,整段影片伴隨著憂鬱的鋼琴配樂。」
- 指令示範(英文):
- "Rainy streets in Taipei at night, neon lights reflecting on puddles. Audio: Crisp sound of raindrops hitting umbrellas, distant muffled traffic, and a melancholic piano melody playing throughout."
3. 動態產品展示(適用於行銷、廣告)
這類指令著重於音效的清脆感(ASMR)與視覺特寫。
- 指令示範(繁體中文):
- 「一顆新鮮的柳橙掉入清澈的水中,水花濺起,慢動作攝影。語音要求:巨大的水花濺起聲(Splash),隨後是氣泡在水中咕嚕咕嚕的聲音,音訊層次分明且具有衝擊力。」
- 指令示範(英文):
- "A fresh orange falling into crystal clear water, slow-motion splash. Audio: Impactful splash sound followed by bubbling water textures, high-fidelity sound effects."
💡 撰寫小秘訣(Tips):
- 使用括號標註語音:在 Prompt 最後加上 [Audio: ...] 或 [Voice: ...] 能幫助模型更精準地識別音訊指令。
- 描述情緒關鍵字:例如「興奮地說」、「低沉沙啞」、「溫柔地細語」,這會直接影響生成語音的語調。
- 指定語言:如果您需要特定語言,務必寫出「以繁體中文配音」或「American English accent」。
如果您已經有具體的腳本或主題,我可以幫您直接轉化為專用的 AI 指令。您想要嘗試哪一種類型的影片?