一間沙龍要做一支完整的社群內容,常見流程是先挑作品照、再把同一個造型做成短影音,最後才補旁白、環境聲或音樂。三個步驟分散在不同工具,人物一變、髮色一跑、節奏不合,就得把前面的決定重新交代一次。
2026 年 7 月 23 日,Black Forest Labs 宣布 FLUX 3 進入 Early Access。它不是單純把三個生成器綁在一起,而是讓同一個基礎模型共同學習圖像、影片與聲音,希望用同一套世界表徵理解人物、動作與事件聲音。
先講結論:方向很值得看,但現在還不能把它當成「生圖、影片、配音全部正式可用」的成熟工具。FLUX 3 Video 與原生音訊已開放 Early Access;FLUX 3 Image 官方則預告在接下來幾週才進入 Early Access。對店家最實際的做法,是先把它當成一個工作流假設來驗證,不要先換掉既有工具。
FLUX 3 實際開放了什麼?
一個模型共同學圖像、影片與聲音
Black Forest Labs 的核心主張是:畫面、動作與聲音不是三件互不相干的事。剪刀碰到髮絲、吹風機運轉、人物說話時嘴型與聲音同步,背後都來自同一個物理事件。FLUX 3 因此在同一架構裡共同訓練影像、影片與音訊,而不是等影片完成後再外接一個聲音步驟。
今天能拿到的是 Video Early Access
官方目前開放的 FLUX 3 Video 可在單次生成中製作最長 20 秒、帶原生音訊的影片,支援文字轉影片、圖片轉影片、影片轉影片、影片與音訊續接、關鍵影格轉影片,以及多語對話。官方也展示用視覺參考維持多段影片中的角色一致性。
這些能力與沙龍內容最相關的地方,是作品照可以成為影片參考,影片又能直接帶聲音,不必每次換工具都從零描述同一個人物、髮型與場景。可是「可以」不等於「每一次都穩定」,官方明確把目前結果稱為早期評估,模型與周邊流程仍在開發。
Image 還沒有跟著全面開放
FLUX 3 Image 的生成與編輯能力已在官方文章中展示,但 Early Access 預計在未來幾週才開放。Black Forest Labs 的現行文件與公開定價頁目前仍以 FLUX.2 系列為主,也沒有公布 FLUX 3 的一般 API 價格、服務層級或正式上市日期。
「少三次重來」是值得驗證的工作流假設,不是 Black Forest Labs 已證明的成效數字。
少三次重來,究竟可能省在哪裡
第一次:作品照定了,影片裡的人物與髮型又變了
現在常見的做法,是先用一個工具修作品照,再把照片交給另一個影片模型。第二個工具不一定理解第一個工具保留了哪些臉部特徵、髮色層次與光線,於是瀏海長度、挑染位置、服裝材質都可能漂移。若圖像與影片真的共用同一套表徵,理論上可以少一次重新鎖定人物與造型的工作。
第二次:畫面剪完,配音與聲音又要重抓節奏
短影音完成後才補聲音,常遇到嘴型、動作點與音效不一致。原生音訊的價值不是「自動幫你配好一切」,而是模型在產生動作時就同時考慮聲音。對吹整、剪髮、染髮揭曉等節奏明確的內容,這可能減少後製重新對點;但台灣口音、美業術語與品牌語氣仍要另外實測。
第三次:每換一個工具,品牌脈絡都要重新交代
色調、鏡位、人物、服裝、店內材質、禁用元素,往往散落在不同提示詞與專案檔。切換工具時如果沒有一份固定內容規格,就容易從「修一個畫面」變成「重新定義整支作品」。統一模型若能沿用圖片與影片參考,最大的營運價值可能是減少這種脈絡搬運,而不只是多一個生成按鈕。
真正要量的不是生成速度,而是「從開始到可發布」的總時間。如果新模型少了兩次工具切換,卻多出四次修手指、修髮絲或修口型,它就還沒有替店家省到時間。
先別換工具:用一個小專案做 7 天驗證
Early Access 最適合做小範圍、低風險的比較,不適合直接接管每週固定發文。選一個不含促銷價格、不牽涉客訴、不需要真實顧客個資的主題,例如「夏季短髮整理」或「染後居家照護」,做一輪前後對照。
第 1 天:先定義同一組交付物
固定只做三樣:一張 4:5 封面、一支 10 到 15 秒直式影片、一段與畫面同步的環境聲或口白。不要一開始就追求多鏡頭長片;交付物越固定,越能判斷到底是模型進步,還是需求一直在變。
第 2 天:把輸入規格鎖成一頁
目的與平台:這支內容要讓誰看、放在哪裡、希望觀眾做什麼。
參考素材:只放已取得使用同意的照片或影片,並標明哪些特徵必須保留。
品牌規格:色調、光線、店內材質、服裝與禁用元素,用同一份文字描述。
文字邊界:價目、優惠、日期與行動呼籲由後製排版,不讓生成模型自行寫。
第 3 到 5 天:同一份 brief 跑兩套流程
先用現有工具做一次,記錄每個步驟耗時、工具切換次數與修改輪數。
若已取得 FLUX 3 Early Access,再用同一份 brief 與同一批參考素材做一次。
由同一位店內負責人驗收,避免兩套流程採用不同標準。
第 6 到 7 天:只看四個數字
第一版可用素材出現前,總共花了幾分鐘。
人物、髮色、場景與聲音一共修改幾輪。
所有輸出裡,有幾成不必修人物一致性就能進後製。
人工修圖、剪輯、重錄與排字合計花了多久。
如果修改輪數沒有下降,或人工修正時間反而增加,就先維持現行流程。Early Access 的價值是提早學習,不是提早承擔不穩定。
四個不能忽略的風險
Early Access 不是正式服務承諾:價格、速度、可用性、輸出規格與 API 契約都可能調整。
多語對話不等於台灣美業已驗證:官方沒有提供台灣華語、髮型術語或沙龍環境聲的獨立評估。
美業畫面特別容易露餡:手指、剪刀握法、髮束層次、鏡面反射、椅子與線材都必須逐格檢查。
授權與同意不能交給模型:顧客臉部、聲音、店內音樂與品牌素材都要先確認使用範圍;生成結果也要由人員決定是否能公開。
NEXT X 怎麼替所有產品管理模型換代
NEXT X AI 模型目錄是跨產品共用的模型能力清冊。它把正式支援、Preview、評估中與已退役分開記錄,也標示每個模型實際接到哪些產品。新模型發布,不代表所有 NEXT X 產品立刻可用;只有完成產品接線與驗證的範圍,才會對外標成正式支援。
對店家來說,這套做法的價值是不用自己追每一個模型名稱,也不必猜哪個版本已經能安全承接工作。FLUX.2 Pro 與 FLUX.2 Flex 目前只在已驗證的 Atlax Remix 圖像流程中列為正式支援;FLUX 3 尚未列入任何 NEXT X 產品的正式支援或 Preview。Atlax 是使用模型的產品線之一,AI 模型目錄則負責呈現各產品的實際支援範圍。
想確認模型目前的 NEXT X 支援狀態、適用產品與換代紀錄,可查看 NEXT X AI 模型目錄。NEXT X 會替所有產品維護這份能力地圖,讓模型可以持續換代,店家的系統與工作流程不用跟著重來。
給沙龍老闆的結論
FLUX 3 最重要的訊號,不是「又有一個更強的生成模型」,而是生成工具開始把照片、影片與聲音當成同一段創作,而不是三個互不相通的工序。這可能把競爭焦點從單張畫面好不好看,推向整套內容能不能保持人物、節奏與品牌一致。
店家現在不必申請新工具,也不必把既有流程砍掉。最值得先做的,是把每次反覆口頭交代的內容整理成一頁 brief,並開始記錄從拍攝到可發布的總時間與修改輪數。等工具真的成熟,你才有基準判斷它是在省時間,還是在換一種方式增加重工。
好的 AI 內容工具,不是讓你生成更多,而是讓同一個決定不必重做三次。
資料來源
FLUX 3 — Real World Models: Towards Multimodal Flow Models as the Backbone of Visual Intelligence(Black Forest Labs 官方發布)
FLUX 3: One Multi-Modal Model(Black Forest Labs 官方模型頁)
Black Forest Labs Documentation(現行公開 API 與推薦模型範圍)
NEXT X AI 模型目錄(NEXT X 公開模型支援狀態)