AI图像处理场景文本编辑ICML2026美图

从中文到小语种都能无痕修改,美图影像研究院(MT Lab)提出全新场景文本编辑方案 | ICML 2026

美图影像研究院(MT Lab)··原文链接
收录于 2026/8/24 09:39:11

"把这几个字改下,其它的什么都别动。"——这个需求看似简单,实则很难完成。文字抠不出来、找不到字体、背景有修改痕迹……即使是专业设计师,也很难做到"看不出来改过"。

基于扩散模型的图像修复虽然实现了"无需分层文件即可修改文字",但只要有一点瑕疵就容易暴露破绽。当前主流方法有两类:

  • 依赖图像修补:容易丢失原始文本区域关键信息,导致字体细节和风格一致性下降
  • 依赖 OCR 或固定字表:容易限制模型在多语言和开放词汇场景下的泛化能力

Self-Prompting 方案核心

MT Lab 提出的方案通过直接从输入图像中提取风格信息,结合目标文本生成高保真字形提示,将二者与原图进行统一建模,实现无需额外编码器的端到端编辑。

Self-Prompting 方法 V.S. OCR 方法

借助多模态扩散 Transformer 的上下文学习能力,方案能在保持原有字体风格、颜色和纹理的同时,实现跨语言、跨场景的高质量文本替换。

输入构建

输入构建阶段分三步:

  1. 字形提示(glyph prompt):通过渲染目标文本生成高保真字形图,提供精确的结构约束
  2. 风格提示(style prompt):从原始图像目标文本区域提取像素级风格信息,编码字体的颜色、纹理和排版特征
  3. 统一编码:将字形提示、风格提示与完整输入图像在像素空间拼接,通过单次编码输入多模态扩散 Transformer,在统一表示下进行细粒度对齐与生成

两阶段训练范式

自监督预训练阶段:基于大规模图文数据训练,冻结编码器与解码器,仅优化 Transformer 主干。不引入特定风格约束,避免过拟合于有限的字体或语言分布,为开放词汇和多语言场景提供泛化基础。

冷却(cooldown)训练阶段:从预训练权重出发,使用约 4000 对人工筛选的高质量配对数据微调。将原始文本区域视为"元信息"通过风格提示引入模型;设计面向目标区域的训练目标,仅在局部文本区域施加学习约束,显式解耦"内容生成"和"风格保持"。在潜空间中对原图与目标图进行插值,学习从源表示到目标表示的变化方向,实现文本内容准确替换并保持视觉风格一致。

实验结果

  • 中英文基准 AnyText:编辑准确性和风格一致性的各项评估指标均取得最优性能
  • 多语种测试集 MSTEdit:覆盖阿拉伯语、法语、德语、韩语、日语、意大利语、孟加拉语、印地语、俄语、泰语、斯瓦希里语等,整体优于已有方法
  • OOV 场景:长尾字符、手动设计符号、现实中不存在的字符等均表现出良好鲁棒性

消融实验表明:预训练阶段及字形提升主要提升文字准确率和泛化性;冷却阶段及风格提示主要提升风格一致性。

落地应用

该方案已应用于美图秀秀"无痕改字"功能,突破传统改字预设词表限制,支持日、俄、韩、泰等小语种文本编辑,保持字体风格与画面质感一致。

论文链接https://arxiv.org/abs/2605.15523

项目主页https://hongxiii.github.io/mstedit/

Zero 的看法

这篇工作最值得关注的点不是"能改多语种文字",而是它放弃了 OCR + 固定字表这条好走但天花板明显的路,转而用 Self-Prompting 让模型自己从原图里提取风格信息。两阶段训练的设计也很聪明——预训练阶段不锁风格约束以换取泛化性,冷却阶段再通过潜空间插值显式解耦内容和风格。从工程角度看,不需要额外编码器意味着部署链路更短,对前端场景集成友好。不过 4000 对高质量配对数据的筛选成本不低,多语种的实际效果在复杂背景(如手写体、艺术字叠加纹理)下是否依然稳健,论文展示的案例偏理想化。落地到美图秀秀说明产品化路径已打通,但"无痕"这个 claim 在极端场景下恐怕还是要打个折扣。

评分:
暂无0 人评分)