繁體
  • 简体中文
  • 繁體中文

熱門資訊> 正文

單個tokenizer勝任圖像視頻理解生成!南大&騰訊混元HYDRA打通多模態統一難題

2026-06-28 11:13

長期以來,原生多模態模型一直存在一個天生短板。

傳統的原生多模態模型如Janus,BAGEL,一般使用兩個視覺Encoder來分別處理理解和生成,看似分工明確,實則埋下了致命BUG。

理解模型的encoder(常用SigLIP 2)學到的是語義特徵,生成模型的encoder(常用VAE)學到的是重建特徵,兩個encoder給出的feature並不在同一個空間里,模型需要額外學習它們之間的映射。

不僅白白浪費算力,模型的效果上限也被死死鎖死。

南大王利民團隊&騰訊混元的HYDRA系列(HYDRA,HYDRA-X)工作挑戰了這個慣例,用一個基於ViT的統一視覺Tokenizer,幫助原生多模態模型更好地「看懂」和「創作」

具體而言,HYDRA做的事情是:

訓練一個基於ViT的Unified Tokenizer,使其同時具有理解和生成的能力,進而同時作為理解和生成的Autoencoder,來支持原生多模態模型(Unified Multimodal Models)的訓練。

HYDRA-X的Tokenizer進一步把這個思想拓展到了視頻的理解和生成。

HYDRA-X原生多模態模型現已支持:圖像視頻理解圖像視頻生成指令引導圖像編輯

傳統原生多模態模型Tokenizer設計範式:解耦Encoder是主流,統一Encoder是趨勢

傳統原生多模態模型Tokenizer設計範式一般可以分為下面幾種。

下圖(a)是把理解Encoder和生成Encoder做解耦,比如BAGEL。這樣做的問題在於理解和生成的視覺特徵不是一致的。

下圖(b)的做法是把理解Encoder和生成Encoder進行串聯,比如Show-o2。這樣做的問題在於信息的過渡太快,用於理解的表徵和用於生成的表徵沒法直接對齊。

下圖(c)的做法是直接使用共享的表徵編碼器,比如UniTok。這樣做的問題在於這個編碼器很難學,因為生成所需要的高頻信號與理解所需的語義是有矛盾的。

本文的HYDRA Tokenizer希望為UMM設計一種Unified Tokenizer,它既能夠很好地完成重建任務,也具有豐富的語義來賦能生成任務。如下圖(d)所示是HYDRA Tokenizer的設計思路。

常見原生多模態框架的Tokenizer方案

HYDRA Tokenizer基於ViT架構。它通過Gen-ViT和一個Decoder完成VAE的任務,即提取latent特徵以及后續的重建。latent特徵會再通過Sem-ViT得到帶有語義的高維特徵。在Gen-ViT和Sem-ViT之間,有一個Generation-Semantic Bottleneck(GSB)模塊來投影到低維latent,再投影回高維特徵。

HYDRA Tokenizer訓練目標

如下圖所示是HYDRA Tokenizer的訓練方法。

重建損失:Decoder包含Flow Matching去噪。因此迴歸損失包含Flow Matching Loss。此外,還有LPIPS Loss和GAN Loss。

蒸餾損失:蒸餾損失是Gen-ViT以及Sem-ViT的特徵與Vision Encoder對齊,作者這里用的凍結參數的Vision Encoder是InternViT。

迴歸損失:迴歸損失包括latent space的KL損失,以及GSB模塊里面降維之前的特徵與升維之后特徵的對齊。

總的訓練目標為重建損失,蒸餾損失,迴歸損失的加權和。

用統一的Tokenizer訓練原生多模態模型

HYDRA UMM遵循了大多數UMM的訓練方法,使用Next-token Prediction建模文本,使用Flow Matching訓練生成。

注意HYDRA UMM的加噪的視覺token使用的是GSB升維之后的視覺特徵。

Gen-ViT和Sem-ViT的配置

作者首先對latent的channel數進行了消融。結果如下圖所示。C=64是sweet spot。

然后,作者對層數的分配也做了消融。結果顯示12+12在PSNR,Avg QA,以及GenEval上都最佳,也是一個sweet spot。

HYDRA Tokenizer的重建效果

作者還評測了HYDRA Tokenizer的重建性能,結果如下圖所示。

從歷史上看,ViT-based Tokenizer的重建能力是被認為不如常規CNN-based Tokenizer的。但是下圖的結果展示了ViT-based Tokenizer的重建也可以做得很好。

多模態理解評測

如下圖所示是多模態理解任務的結果。在1.5B這個量級,HYDRA的平均分是63.1,大幅超過了基線Show-o2的53.2。縮放到7B以后,HYDRA繼續領跑,在MMStar和SEED這種複雜推理任務上超過Show-o2。

多模態生成評測

如下圖所示是生成的結果。在1.5B規模,HYDRA的GenEval和DPG-Bench大幅超越了Show-o2。在7B規模,HYDRA超過了Ming-UniVision和FLUX.1[Dev]。

HYDRA思想適配視頻任務

HYDRA-X沿用了HYDRA的技術路線,即使用單個基於ViT的Unified Tokenizer來作為理解和生成的Encoder。不同的是,HYDRA-X Tokenizer在圖像理解和生成的基礎上,進一步支持了視頻的理解和生成

HYDRA-X聚焦的是把這種Unified Tokenizer從Image適配到Video,需要面臨的兩個問題:

問題1:把時空重建能力注入到ViT里面。

問題2:把圖像和視頻的語義嵌入到共享的latent里面。

HYDRA-X的Tokenizer(Gen-ViT和Sem-ViT)採用SigLIP 2初始化。

問題1:給ViT注入時空重建能力

之前的ViT-based Tokenizer有兩個設計共同點:

對所有幀使用full spatialtemporal attention。(隨clip長度帶來平方複雜度)

temporal維度使用1步patchify壓縮。(壓縮過程比較激進,損失細粒度時序信息)

針對這些設計和問題1,HYDRA-X給出了兩個在tokenizer上的改進:

其一,不需要用很多attention,2-frame turbelet attention的重建效果最好。

其二,逐步patchify勝於一步patchify,把時間維度patchify過程從單步4倍壓縮改為兩步2倍壓縮提升重建效果。這説明時間維度受益於逐步壓縮。

下圖是不同的時空重建設計方案。

下圖是不同設置下的重建結果對比。

問題2:時空語義蒸餾

HYDRA給Gen-ViT和Sem-ViT都用了語義蒸餾,對齊預訓練的Image Teacher(InternViT)。

HYDRA-X用類似的辦法,把Sem-ViT的輸出與Image Teacher(SigLIP2)和Video Teacher(InternVideo-Next)對齊。

對於Image來講對齊比較容易;但是對於Video而言,壓縮之后只剩下1+T/4幀,沒法與Teacher Video Encoder直接對齊。

HYDRA-X的方案是引入一個輕量級的Decompressor,如下圖所示。Decompressor是一個很小的ViT,將temporal維度拉回到未壓縮的維度。這樣一來,就可以用Image Teacher和Video Teacher分別對齊了。

Decompressor只用在Tokenizer預訓練階段;后續丟棄。換句話説,LLM喂入的仍是壓縮后的Sem-ViT的輸出。

如下圖所示,作者進行了一些消融實驗。結論是:

語義蒸餾是很有必要的。

Decompressor使得HYDRA-X Tokenizer可以與Video Teacher進行對齊,Video Understanding性能最佳。

給Sem-ViT換bidirectional attention會損失所有測試的性能。

通過Decompressor同時進行與Image Teacher和Video Teacher的對齊,使得latent有更顯式的時空語義結構,進而同時改善理解和生成。

HYDRA-X使用一個共享的Tokenizer做5個任務:圖像理解,圖像生成,視頻理解,視頻生成,圖像編輯。與HYDRA UMM一樣,HYDRA-X UMM也使用Next-token Prediction建模文本,使用Flow Matching建模視覺信息,即圖像和視頻。

圖像編輯:在Tokenization階段做交互

值得一提的是,對於圖像編輯任務,HYDRA-X並不是把source image和target image分別獨立過一下Tokenizer。作者認為這種做法會使得二者在Tokenization過程中缺乏交互。

HYDRA-X的做法是:使得source image和target image在Tokenization階段就進行交互。具體做法是:Gen-ViT還是獨立地編碼各自的image。

到了Sem-ViT之后,開始交互,使用tubulet causal mask,如下圖所示。

如下圖所示是上述做法的消融實驗結果。這里主要想對比的是在圖像編輯中,editing pair是分別進行編碼,還是在Sem-ViT中,以leng-2 clip的形式,通過tubelet causal attention,整合在一起。在Tokenization過程中進行交互的做法對於ImgEdit和Recon-PSNR都有幫助。

Latent-level的交互對於圖像編輯而言很重要。在Sem-ViT中,藉助tubelet causal attention來對source image和target image做交互,無需添加額外的參數,且可以提升編輯性能。

HYDRA-X的bottleneck dimension是64。

HYDRA-X的Image Teacher使用SigLIP-SO400M-patch16-naflex,Video Teacher使用InternVideo-Next-L。

圖像理解評測

視頻理解評測

多模態生成評測

圖像編輯評測

風險及免責提示:以上內容僅代表作者的個人立場和觀點,不代表華盛的任何立場,華盛亦無法證實上述內容的真實性、準確性和原創性。投資者在做出任何投資決定前,應結合自身情況,考慮投資產品的風險。必要時,請諮詢專業投資顧問的意見。華盛不提供任何投資建議,對此亦不做任何承諾和保證。