熱門資訊> 正文
2026-09-22 20:53
財聞 顧群生 發自杭州
六七張參考圖,可以生成一段30秒短劇;一個六人團隊,已經運營起十幾個AI歌手。
9月22日,在雲棲大會視聽生成分論壇上,阿里介紹了千問圖像模型Qwen-Image-2.1的更新,展示萬相視頻生成模型在短劇、音樂MV等場景中的應用,併發布音樂生成模型Happy Shrimp 1.1。
千問生圖強化編輯,支持多圖組合
阿里巴巴(BABA.US)ATH事業群Token Foundry Qwen-Image技術負責人吳晨飛介紹,Qwen-Image-2.1已於9月20日開源,視覺生成部分參數規模為70億,支持圖像生成與編輯。此次更新重點包括原生透明圖像、多圖輸入、局部編輯,以及人物和商品特徵的保留。
吳晨飛在現場展示了多張參考圖組合生成的案例,包括將六張人物照片合成一張合影,將上衣、褲子、帽子等搭配到模特身上,以及輸入空房間和家俱圖片,生成室內佈置效果。
針對局部修改,模型提供圈選、塗抹和掩碼等方式。用户可以圈出需要修改的區域,通過文字説明調整要求;也可以保留原圖,額外輸入一張標記修改區域的圖片,減少對原始畫面的干擾。
透明圖像的生成和編輯也是此次更新的重點。吳晨飛以火焰特效為例解釋,透明度不僅涉及摳圖,還包括火焰邊緣與中心不同的透明程度。模型原生支持透明圖像后,創作者可以生成、修改獨立素材,再進行拼接。
在人像和商品編輯中,模型需要處理姿態變化與細節保留之間的問題。例如,手串從平放變為戴到手腕上后,仍需保持商品特徵;衣物穿到模特身上后,也要保留複雜紋理。
吳晨飛表示,在短劇分鏡製作中,輸入人物多個角度的參考圖,有助於保持不同鏡頭中的人臉一致性。
對於模型規模,吳晨飛表示,團隊追求在達到可用標準的前提下,儘可能減少完成任務的成本。他同時透露,Qwen-Image-3.1正在推進中。
英特爾(INTC.US)首席工程師、端側AI首席架構師羅寧介紹,英特爾已在Qwen-Image-2.1發佈首日完成支持,后續將與千問團隊繼續推進端側適配和優化,讓圖像生成與編輯能力在本地設備上運行。
萬相3.0,跨鏡頭一致性仍是難點
視頻生成部分,阿里巴巴ATH事業群Token Foundry多模態生成算法科學家張士偉圍繞萬相3.0介紹了技術進展。模型支持文本、圖像、視頻和音頻的組合輸入,團隊主要從畫面、運動和音頻三個維度改善生成效果,包括提高畫面細節、減少運動崩壞和穿模,以及改善人聲、音效和音色一致性。
現場播放了影視短片、短劇、電商廣告和音樂MV等案例。據張士偉介紹,其中一段30秒短劇由六七張參考圖生成。電商廣告案例中,模型根據標有拍攝要求的參考圖生成視頻,音樂MV案例重點展示了音樂節奏與視頻內容的配合。
對於更長視頻的生成,多模態生成算法科學家姜文韜表示,用户已不滿足於數秒的簡單片段,而是希望精準控制人物、場景和運鏡,並讓這些要求在多個鏡頭中持續成立。
他指出,隨着條件增多、時長增加,僅靠細化文字描述,模型仍容易遺漏局部要求,難以保持前后一致。團隊正在探索引入圖像、音頻、視頻,以及佈局、軌跡等控制信息,並圍繞創作要求規劃劇情、分鏡和參考素材。
音樂模型更新,AI歌手探索變現
音樂方面,Happy Shrimp技術負責人林軒介紹,1.1版本加強了對創作意圖的理解,並改善旋律、編曲層次和演唱表達。例如,針對過去部分AI音樂編曲過滿的問題,新版本更注重段落留白和情緒推進。
林軒同時表示,目前還無法隨意控制音樂中的任意元素。如何在修改某段鼓組時保留旋律、人聲和其他段落,仍是團隊希望進一步解決的問題。
小旭音樂創始人盧小旭隨后展示了團隊製作的AI歌手。他介紹,音樂、語音和視頻需要藉助不同工具完成,角色還要經過形象篩選、音色訓練和持續運營。
目前,六人團隊運營十幾個數字歌手,正在嘗試廣告、MV定製和數字人孵化等業務,商業變現仍處於早期探索階段。