热门资讯> 正文
2026-08-12 17:30
(来源:机器之心)
机器之心发布
过去两年,AI 生成图片、视频的能力不断刷新人们的认知。
今天,生成一张图片、一段视频,已经变得很容易。
但真正困难的,是另一件事情:让 AI 理解并按照创作者的真实意图完成创作。
比如:
修改一行文字,同时保留字体、排版和视觉风格。
消除图片和视频的冗余元素,但不能看出破绽。
自由变换发型、服饰、光线、场景,但要保持人物一致性。
修改视频中的局部内容、调整光影效果,不要影响整体连续性。
让模特试穿试戴,同时准确保留材质、纹理和光泽。
Prompt 的后半句都是为规避模型误差添加的限制,「保持一致、避免失真、不要改变」等等一长串的提示词,是 AI 创作流程中的「惯用套路」。但理想状态下,我们对 AI 的期望是需求能够被理解,并直接执行,而不是先要学习如何正确使用提示词。
AI 在视觉创作能力的进化,实则是视觉理解、空间建模、时序一致性、美学表达等多个方向的持续突破,这很难通过一次模型升级来实现,而是需要围绕视觉技术的长期积累。
更重要的是,这些研究成果不断通过产品落地,转化为服务真实创作场景的 AI 影像能力。
在专业的创作中,生成其实只是起点,人们往往需要经过多次的尝试和调整,才能不断接近「理想效果」。因此,无论是视频中的背景、光线、人物身材、妆造,还是图片中的文字、服饰配饰,模型都需要同时兼顾一致性、真实性与可控性,这也是 AI 影像从「能生成」迈向「能创作」最关键的能力之一。
论文链接:https://arxiv.org/abs/2605.14664
项目主页:https://mivepaper.github.io/
MiVE 在细腻发丝的处理、服饰的贴合度、材质光影层面都拥有良好表现力,能够精准还原对人物、发丝、衣服材质、光线等细节。
例如在视频打光场景中,相比主流模型,MiVE 在人物与环境一致性维度均有较为明显的优势,据悉该能力即将上线美图秀秀 APP 与 Wink APP 的「氛围光」功能。
对光影变化的控制能力同样延伸到了静态图片创作场景,在 ECCV 2026 中,美图影像研究院(MT Lab)提出了一致特征传输重打光新方案 Consistent Feature Transport(CFT)。
CFT 通过将人像重打光表述为「光照一致的特征传输问题」,在 Rectified Flow 框架上显式学习源图与目标图分布之间的光照变换,并结合大规模人像重打光数据集,实现在复杂光照场景下,人物身份、姿态、背景的超强一致性。
论文链接:https://arxiv.org/abs/2607.17833
项目主页:https://github.com/Dixin-Lab/CFT
CFT 对光线的方向、角度、强弱具备更强的可控性,可以实现各种不同类型的打光效果。对比主流模型,CFT 在光照效果上有更佳的稳定性和合理性,即使是在复杂的场景下,也表现出高一致性的打光效果。例如在晨光场景中,CFT 能准确区别晨光与夕阳光,呈现更好的整体氛围感和光线真实性。
结合 CFT 方案,你不需要输入冗长的提示词,就可以玩转各种不同的光线效果。
全新的「图片打光」功能已经上线美图主打人像修图 Agent 与「学我修图」的全新 AI 产品 Picchi,海外可以通过 AirBrush 与 BeautyPlus 进行使用。
自去年推出「AI 闪光灯」全球爆火后,美图影像研究院(MT Lab)目前已经研发超过 50 种不同的打光效果,帮助「手残党」拯救废片。
对此,美图影像研究院(MT Lab)在 ICML 2026 上提出了基于随机桥模型的新框架 ——BridgeRemoval,首次将「视频目标移除」定义为「视频到视频的翻译任务」,通过构建基于随机桥(VP-SDE Bridge)的直接生成路径,在背景保真度与生成灵活性之间取得更好的平衡,显著提升了视频目标移除的精准度及时序一致性,实现了从 AI 图像消除向 AI 视频消除的拓展。
论文链接:https://arxiv.org/pdf/2601.12066
项目主页:https://bridgeremoval.github.io/
不同于标准扩散模型从随机高斯噪声起步,BridgeRemoval 采用基于方差保持随机微分方程(VP-SDE)的桥模型,能够选择性地只对被遮罩区域进行变换,并实现对背景内容中未被遮挡区域最大程度的保真。
结合 BridgeRemoval 在目标移除、背景保真度、时序一致性的显著优势,Wink APP 推出了「视频身材美型保护」功能,解决了平常瘦脸、瘦身等视频美型任务中,容易出现的栏杆变弯、背景形变等尴尬问题。
基于 BridgeRemoval 的优势,也为视频消除能力带来了显著提升,相比主流模型的整体性能,缩短了约 80% 的处理时长,且区别于 10 秒的视频处理限制,BridgeRemoval 可以支持无限时长的视频消除。
尤其在文字场景,BridgeRemoval 对各类型文字均表现出极佳的消除效果,即使是特殊的发光字幕也能实现无痕消除。
目前该能力即将上线开拍 APP「智能全消」功能,能够自动识别与消除视频文字,支持最长 5 分钟视频输入,实现画面无损效果,相较主流模型最长 30 秒视频输入及 Token 消耗模式,使用成本更低。
论文链接:https://arxiv.org/abs/2605.15523
项目主页:https://hongxiii.github.io/mstedit/
目前该能力已通过「无痕改字」上线美图秀秀 PC 端,覆盖汉字、拉丁字母、阿拉伯字母、梵文、西里尔字母在内的全球五大主流文字书写形式,即使是非文字形式的特殊符号也能完成改写。
回到美图最为擅长的人像领域,造型作为人像的关键一环,难点在于需要同时理解材质、纹理、光照以及人与场景之间的关系。对此,美图影像研究院(MT Lab)在 ECCV 2026 上提出了面向原生 2K 多服饰试衣的新框架 ——WearWow。
论文地址:https://arxiv.org/abs/2607.19923
2K 分辨率是目前电商图片用于展示服饰鞋帽细节及质感的标配,但多件服饰鞋帽共同输入时,Virtual Try-On 的试衣方案容易导致显存消耗与耗时均显著增加,且试穿效果不佳。
而扩散模型在高分辨率下易出现纹理退化现象,羊毛、牛仔、针织等特殊材质会有明显的「塑料感」,虽然这些方案基本都已经能够「穿对衣服」,但距离真正商用还有较大的差距。
对此,WearWow 采用 Adaptive 2D Token Packing(ATP)解决了计算效率问题,实现端到端的多服饰生成,再利用 Multi-dimensional Try-on Reward(MTR)进一步调整模型生成方向。基于对穿戴关系的精准理解,WearWow 将试衣方案从「替换服装」升级为「真实穿戴」,即使是在 2K 高分辨率下,依旧能够保持羊毛、棉麻、粗针织等等服饰材质的真实质感。
在多件服饰、鞋帽等不同单品组合输入条件下,模特身着汉服、礼服等结构复杂的服饰,WearWow 也能够避免层叠关系混乱与穿戴错乱,提升复杂试装场景下的真实感与稳定性。
面对大面积遮挡、特殊姿态等复杂场景,WearWow 能够实现自然贴合的服装生成,真实还原服饰材质、纹理与质感。
对比主流的通用模型,WearWow 结合了智能场景识别能力,即使穿戴目标中存在干扰元素,比如穿戴图中包含鞋子,但模特是半身场景,WearWow 的试穿效果也不会错误改变人物姿态。
凭借 AI 试衣的玩法功能火遍全球之后,AI 试衣的能力也在进一步向商用场景扩展,目前该能力已经上线美颜相机 APP 的「AI 换装」功能和美图设计室「服饰穿戴」「换模特」与「AI 试衣」功能。
在 CVPR 2026 上,美图影像研究院(MT Lab)提出 All-in-One Slider,将「一项属性对应一个滑块」的 One-for-One 模式,拓展为统一的多属性控制框架,实现对年龄、笑容、妆容、发型等多种图像属性的连续控制,支持多属性间的自由组合以及针对模型训练中未见属性的零样本泛化,同时能够更好地保持人物身份、背景及其它非目标内容的一致性。
论文链接:https://www.alphaxiv.org/abs/2508.19195
可以看到,美图影像研究院(MT Lab)对 AI 影像能力的推进,并不止于拓展能力的边界,还在于提供更高自由度和更极致、稳定的视觉效果。而当 AI 能力的边界越开放,对模型理解画面、约束变化的要求也越高,这也取决于模型的另一层能力 —— 理解与控制。
让 AI 实现更精准的理解与控制
落到具体的创作场景,这种理解与控制涉及多个层面,对此,美图影像研究院(MT Lab)从不同方向持续提升模型在理解与控制层面的准确性、真实性与可控性。
在 ICML 2026 上,美图影像研究院(MT Lab)针对「分割对了却选错了」的语义对齐失效问题,提出了基于双向语义流的条件分割方法 ——FlowSeg。
论文链接:https://arxiv.org/abs/2605.29461
项目主页:https://zkzhang98.github.io/FlowSeg_page
FlowSeg 重新定义了「语言」在 LLM 条件分割中的角色,在每一解码层用语言条件引导查询特征的更新,使得生成过程中 Mask 始终与语言描述保持一致,同时不断吸收来自解码器的视觉证据,并随着 Mask 的逐渐清晰进行动态更新。
结合 AI 图像消除能力与 FlowSeg 在复杂场景下对丰富类别物品的语义对齐与分割,美图云修、美图秀秀 APP 上线「杂物消除」功能。
不需要手动选择,AI 就可以智能识别并消除包括电线杆、路牌、告示、应急出口、落叶、垃圾等等物品在内的所有杂物,并实现「无痕消除」。
在 ICLR 2026 上,美图影像研究院(MT Lab)提出了基于 DiT 的 3D 位置编码框架 ——Positional Encoding Field(PE-Field),基于对 DiT 中画面空间结构很大程度上由位置编码组织这一发现,将传统的 2D 位置编码扩展为带有深度信息的 3D 位置编码场,并通过多层级位置编码将空间控制从 Patch 进一步细化到更小的局部区域。
论文链接:https://arxiv.org/abs/2510.20385
项目主页: https://github.com/MTLab/PE-Field
在空间生成之外,美图影像研究院(MT Lab)也在关注动态人像中的真实感问题。比如,动态视频中人物头发、衣物等柔性材质的运动,往往会对画面的可信度造成较大影响。
由于头发高自由度、细长结构、自碰撞和复杂光照交互的特性,导致它在视频生成中难以显式控制。但在现有的视频生成技术路线中,文本驱动很难让发丝按照具体的风向和力度描述摆动;姿态驱动中的骨骼信号则不包含发丝信息,头发只能依赖模型先验「自行发挥」。
对此,美图影像研究院(MT Lab)在 ECCV 2026 上提出动态毛发渲染框架 ControlHair,将物理模拟器与视频扩散模型进行级联,通过将物理仿真与画面生成解耦,实现了可控、真实的动态发丝渲染,让发丝效果从「看起来在动」变成「按照物理规律运动」。
论文链接:https://arxiv.org/abs/2509.21541
项目主页:https://linwk20.github.io/controlhair-web
与此同时,围绕在发丝结构、材质与视觉表现方向上的长期积累,美图影像研究院(MT Lab)持续将其转化为美发场景中的产品能力,目前已上线「发丝飞扬」「飘逸发光」等多款氛围感美发功能。
进入视频场景,影响视觉表达的还有一项很关键能力 —— 镜头语言。比如在画面中逐渐被放大的人物,可能是来自于主体向镜头靠近、相机推近或者是镜头焦距发生变化,但它们所传递的空间感、叙事重点和情绪完全不同。随着 AI 视频迈向 MV、短剧、影视等更专业的创作场景,只是生成「会动的画面」还远远不够,模型还需要真正地理解镜头语言。
在过去,运镜理解往往被当作视频理解中的附属问题,美图影像研究院在(MT Lab)ECCV 2026 上首次将「自然语言镜头运动理解」确立为独立研究问题,系统梳理了视觉语言模型(VLM)在自然语言镜头运动理解上的五大失效模式,并构建了首个同时覆盖 17 类运镜、涵盖真实与合成视频的评测基准 ——ACaM(Atomic Camera Movement)。
在此基础上,美图影像研究院在(MT Lab)通过重采样和针对性数据增强,整理出 2.7 万条类别更均衡的训练数据对 VLM 进行微调,验证了其对模型运镜理解能力的显著提升。
论文链接:https://arxiv.org/abs/2607.03043
项目主页:https://1yuwen.github.io/ACaM-Project-Page/
让 AI 实现更自由的交互
当模型理解、控制、生成的能力持续变强,单一的交互方式已经难以适配所有创作任务,很多时候复杂的需求甚至难以用文字清晰说明。
随着生成能力进化为更通用的基础能力,AI 影像真正的较量也开始深入真实创作场景,美图影像研究院(MT Lab)将前沿研究、专业数据、模型评测、工程落地环环紧扣,为美图形成真正可落地的产品力,而长期深耕 AI 影像的价值,也在这些细节中显现 —— 在持续抬高模型能力上限的同时,让 AI 产品真正从「可用」走向「爱用」。