MiniMax H3 的 @ 參照系統如何重新定義「指令」的意義

sinpo.wang
·
·
IPFS
·
當 AI 影片生成從「用文字描述你要什麼」轉向「直接展示你有什麼」,創作者與模型之間的權力關係正在發生結構性轉移。從 MiniMax H3 的 @ 參照系統談起。

從「描述」到「展示」:一次介面層的典範轉移

過去三年,所有 AI 影片生成工具都在問同一個問題:「你想要什麼樣的影片?請用文字描述。」

這個問題看似合理,實則暗藏一個深層假設——它假設語言是傳遞視覺意圖的合適載體。但任何曾試圖用文字向設計師解釋「我想要的感覺」的人都知道,語言對視覺概念的壓縮是有損的。「溫暖的黃昏光線」在不同人的腦中對應不同的色溫、不同的陰影角度、不同的空氣質感。文字是一把寬齒梳,而視覺意圖需要的是密齒梳。

2026 年 7 月 31 日,上海稀宇科技(港交所代碼:100)發佈了 minimax h3,一個接受文字、圖片、影片、音檔混合輸入的全模態生成模型。它最引人注目的設計不是 2K 解析度或原生立體聲——這些是可量化的指標,同行遲早會追上——而是它的 @ 參照系統。

這個系統允許使用者上傳最多 9 張參照圖片、3 段參照影片、3 段參照音檔,並在文字提示詞中用 @ 標籤為每項素材指定角色:@Image1 作為人物外觀、@Video1 作為鏡頭運動參考、@Audio1 作為背景音樂風格。模型將文字和所有被標記的素材作為統一上下文處理,生成綜合了所有參照的影片。

表面上,這只是多了一個上傳功能。但從創作方法論的角度看,這是一次介面層的典範轉移。

文字提示詞的權力結構

在純文字提示詞的工作流中,有一個經常被忽略的權力分配問題:誰決定了視覺細節?

答案不是創作者,而是模型。

當你寫下「一個女人走在雨中的街道上」,這句話留下了數百個未指定的變數:女人的年齡、穿著、髮型、膚色、步態;街道的寬度、材質、時代感;雨的密度、角度、光線反射方式。這些變數全部由模型根據訓練數據的統計分佈「自動填入」。創作者以為自己在「指導」模型,實際上更接近於向模型「許願」,然後接受模型基於概率分佈做出的詮釋。

這就是為什麼文字提示詞工作流總是需要大量迭代——不是因為模型「不懂你的意思」,而是因為你的文字根本沒有承載足夠的資訊來消除那些變數的歧義。

參照系統如何把決策權交還創作者

@ 參照系統改變的不是模型的能力,而是決策權的分配。

當你上傳一張照片作為 @Image1 並指定「人物外觀參照 @Image1」,照片中的色溫、質感、構圖風格就變成了硬約束,而不是軟建議。模型不再從訓練數據的統計分佈中「猜測」你想要的視覺風格——它直接從你提供的參照中「讀取」你展示的風格。

這意味著那數百個未指定變數中的一大部分,現在由創作者通過素材選擇來顯式決定,而不是由模型隱式填入。文字提示詞的角色從「完整描述」退化為「連接指令」——不是告訴模型世界長什麼樣子,而是告訴模型如何組裝你已經展示給它的零件。

類比:文字提示詞像是口頭描述一幅畫給畫家聽;@ 參照系統像是把參考圖釘在畫板旁邊,然後告訴畫家「這個色調、那個構圖、這首歌的節奏感」。後者的資訊損失遠小於前者。

這對獨立創作者意味著什麼

Artificial Analysis 影片排行榜 上,H3 在影片編輯類別排名第 1(Elo 1,130)。這個類別測試的不是從零生成影片的能力,而是編輯現有素材的能力——替換人物、改變背景、轉移動態——這正是參照系統的主場。

對獨立創作者而言,參照系統的實質意義是:你的既有素材庫變成了 AI 的輸入語言。

攝影師的作品集不再只是作品集,而是可以被直接餵入模型的風格參照庫。影片創作者拍過的鏡頭運動,不再只是成品的一部分,而是可以被提取、轉移到新場景的動態指令。音樂人的作品片段,不再只是聽覺體驗,而是可以驅動影片情緒氛圍的參照信號。

這讓「擁有大量既有素材」的創作者比「只會寫提示詞」的使用者獲得了結構性優勢。你過去累積的每一張照片、每一段影片、每一個音檔,都變成了一種可被機器直接理解的創作資本。

參照系統的局限

公允地說,幾個問題需要指出。

首先,參照素材之間的衝突由使用者自行管理。如果你上傳了一張暖色調照片和一段冷色調影片作為參照,模型沒有明確的衝突解決機制——它會選擇其中一個(或生成介於兩者之間的奇怪折衷),但不會提前告訴你存在衝突。策展參照素材的一致性,是使用者的責任。

其次,完全原創的想像內容仍然依賴文字。如果你腦中的場景不存在於任何已有的照片、影片或音檔中,你無法上傳參照,只能回到文字描述模式。參照系統放大的是「已有素材」的價值,對「從零想像」的場景沒有額外幫助。

第三,人臉在動態中的變形問題,不因參照系統的存在而改善。這是模型層面的限制,不是輸入介面的問題。

介面如何塑造創作

McLuhan 說「媒介即訊息」。套用到 AI 創作工具上:介面即方法論。

文字提示詞介面塑造了一種「語言先行」的創作方法——你先用文字想清楚,再讓模型翻譯成視覺。參照系統塑造的是一種「素材先行」的創作方法——你先收集視覺和聽覺素材,再用短句把它們串起來。

兩種方法論沒有高下之分。但對於視覺思維型的創作者——那些想法先以畫面而非文字浮現的人——參照系統終於提供了一個不需要把視覺思維強行翻譯成文字的入口。

這大概是 H3 最值得關注的地方:不是它生成的影片有多好(那是技術指標的軍備競賽,會被持續追平),而是它改變了「創作者如何向機器傳達意圖」的基本方式。這種介面層面的改變,往往比底層模型的性能提升更深遠地影響創作生態。

CC BY-NC-ND 4.0 授权
已推荐到频道:时事・趋势

喜欢我的作品吗?别忘了给予支持与赞赏,让我知道在创作的路上有你陪伴,一起延续这份热忱!