Higgsfield 知識庫

Seed Audio 1.0|提示詞教學(繁體中文)

項目 內容
模態 音訊(audio)
供應商 ByteDance
CLI / MCP 模型 ID seed_audio
驗證狀態 ✅ 已核實(官方來源)
資料存取日期 2026-10-08
原始英文提示詞 一律保留原文,不作改寫;中文為解說/意譯

1. 一句話定位

Higgsfield 音訊預設模型。網頁版定位「多人場景」:對白與環境聲一併生成,聽起來像在同一個物理空間。設定:自由描述提示(可用 @ 引用附件)、50+ 聲音預設、取樣率 8000–48000 Hz(預設 24000)、 速度/音量、輸出 mp3/wav/opus。CLI 亦用於 SFX、環境聲、擬音、衝擊聲與類音樂音訊;可選 audio_references 或 image_references(互斥)。

官方定位(原文):Default audio generation. Use for text-to-audio, sound effects, ambience, foley, impacts, environmental audio, voice-style generations, and music-like audio. Requires --prompt; optional references use --audio-references/--image-references.
— 來源:skills-catalog

2. 規格速查

項目 規格 來源
聲音預設 50+ blog:higgsfield-audio
取樣率 8000–48000 Hz(預設 24000) blog:higgsfield-audio
輸出 mp3 / wav(預設)/ opus blog:higgsfield-audio
聲音一致 選定預設 → 調表情強度、情緒滑桿(憤怒↔開心)、速度、音高、音量 → 開「Save settings」重用 blog:consistent-ai-voice-across-videos

3. 提示詞結構公式

SFX:   [one sound] + [recording space/mic distance] + isolation ("no music" / "no voice" / "no ambience")
Music: [mood] + [tempo] + [instrumentation] + "instrumental, no vocals"
Voice: [the exact line] (performance direction only via supported prompt/settings)

官方 Skills 遊戲音訊規則:每個 SFX 提示只描述一個聲音,不要要求完整混音場景;需要隔離時寫明 no music / no voice / no ambience;音樂寫情緒、速度、樂器與 instrumental/no vocals;語音提示寫出確切台詞。

來源:skills-repo(⚙️ 公式由本知識庫根據來源歸納)

flowchart TD
  A{要甚麼聲音?} -->|單一音效| S[一個聲音 + 空間/收音距離 + no music]
  A -->|環境| AM[環境描述 + 時間/地點]
  A -->|對白多人| D[台詞 + 預設聲音 + 環境一併生成]
  A -->|音樂| M[情緒 + 速度 + 樂器 + instrumental]
  D --> SV[Save settings 鎖定聲音]
  S --> MIX[本地標準化:Voice -6 / SFX -10~-12 / Music -18~-20 dBFS]
  AM --> MIX
  M --> MIX
  SV --> MIX

4. 技巧與範例提示詞

4.1 單一隔離音效

範例提示詞(英文原文,逐字引用):

higgsfield generate create seed_audio \
  --prompt "short isolated sword impact, dry studio recording, no music" \
  --wait \
  --json

中文解說:官方 Skill 範例(譯:短促、獨立的劍擊聲,乾聲錄音室錄製,無音樂)。「dry studio recording」指定空間、「no music」做隔離。

來源:skills-repo

4.2 以參考音訊保持同一把聲、只改語氣

範例提示詞(英文原文,逐字引用):

higgsfield generate create seed_audio \
  --prompt "same voice, calmer delivery" \
  --audio-references ./voice.wav \
  --wait

中文解說:官方範例(譯:同一把聲,更平靜的語氣),配 --audio-references ./voice.wav。

來源:skills-media-inputs

4.3 預設/複製聲音說一句台詞

範例提示詞(英文原文,逐字引用):

higgsfield generate create seed_audio --prompt "Welcome to the show!" --voice_type preset --voice_id <voice_id> --wait

中文解說:官方 CLI 範例。--voice_id 與 --voice_type 由 higgsfield voices list 取得(可為 preset 或複製聲音 element)。

來源:cli-models

4.4 環境聲

範例提示詞(英文原文,逐字引用):

cinematic rain ambience with distant thunder

中文解說:官方 Skill 範例(譯:電影感雨聲環境,遠處雷聲)。

來源:skills-generate

4.5 「先聲後畫」:音訊作為影片模型的參考輸入

範例提示詞:(來源未提供可逐字引用的範例 — 待補)

中文解說:官方反向流程:①先用 Seed Audio 1.0 生成對白/環境聲;②確認節奏與長度配合計劃的鏡頭;③把音訊作參考輸入接到 Cinema Studio、Seedance 2.0 或 Kling 3.0;④生成影片,動作有機會對上聲音;⑤若不同步,通常以同一音訊重生影片較快。

來源:blog:higgsfield-audio

5. Do / Don't 清單

✅ Do ⛔ Don't
每個 SFX 一個聲音 要求一次生成完整混音場景
需要隔離就寫 no music / no voice 為廣告影片另外配聲(Marketing Studio 用 --generate_audio)
一個角色鎖定一把聲並 Save settings 同時傳 audio_references 與 image_references
本地做響度標準化

來源:skills-repo, blog:consistent-ai-voice-across-videos, skills-catalog

6. CLI 參數表(自動擷取自官方 MODELS.md)

自動解析 cli-models;以 higgsfield model get <id> 取得即時 schema。

seed_audio — Seed Audio 1.0

flag 必填 預設 可選值
--audio-references (or --audio) (0..2) false — UUID or path
--format false wav wav, mp3, pcm, ogg_opus
--image-references (or --image) (repeated) false — UUID or path
--loudness_rate false 0 integer
--pitch_rate false 0 integer
--prompt true — string
--sample_rate false 24000 8000, 16000, 24000, 32000, 44100, 48000
--speech_rate false 0 integer
--voice_id false — string
--voice_type false — preset, element
higgsfield generate create seed_audio --prompt "Welcome to the show!" --voice_type preset --voice_id <voice_id> --wait

來源

詳見同資料夾 sources.md。所有事實存取日期:2026-10-08。