新ObjectMover是什么?一文让你看懂新ObjectMover的技术原理、主要功能、应用场景

来源:卓商AI
发布时间:2025-04-05

ObjectMover概述简介

ObjectMover 是香港大学和 Adobe Research 联合提出的新型图像编辑模型,解决图像中物体移动、插入和移除时出现的光照、阴影不协调以及物体失真等问题。将物体移动视为两帧视频的特殊案例,利用预训练视频生成模型的跨帧一致性学习能力,通过微调模型将其迁移到图像编辑任务。模型采用序列到序列建模,输入包括原始图像、目标物体图像和指令图,输出为物体移动后的合成图像。

ObjectMover的功能特色

物体移动:可将图像中的物体移动到指定位置,自动调整相关的物理效果,如光照、阴影、反射等,同时保持物体的身份特征。

物体删除:能真实地填充被移除物体的背景,非生成不相干的新物体,准确地移除与物体相关的光影。

物体插入:能精准保持被插入物体的身份特征,自动生成与环境一致的光影效果。

ObjectMover的技术原理

视频先验迁移:ObjectMover将物体移动任务视为两帧视频的特殊案例,利用预训练视频生成模型(如扩散模型)对跨帧一致性的学习能力。通过微调模型,将其从视频生成任务迁移到图像编辑任务。能充分利用视频模型预训练时习得的物理规律及物体对应关系,在图像编辑任务中实现精确的光影同步与身份特征保持。

序列到序列建模:模型将物体移动任务重构为序列预测问题。输入包括原始图像、目标物体图像、指令图(标注移动位置与方向),输出为物体移动后的合成图像。使模型能更好地理解和处理物体在不同位置下的光影变化和遮挡关系。

合成数据集构建:由于缺乏大规模物体移动的真实数据,研究团队使用现代游戏引擎(如虚幻引擎)生成高质量合成数据对。数据涵盖了复杂光照、材质和遮挡场景,增强了模型训练的多样性和泛化能力。

多任务学习策略:ObjectMover结合了物体移动、移除、插入及视频数据插入四个子任务,通过统一框架在合成数据与真实视频数据上进行训练。提升了模型对真实场景的泛化能力,使模型在处理不同图像编辑任务时表现出更高的适应性和鲁棒性。

ObjectMover项目介绍

项目官网:https://xinyu-andy.github.io/ObjMover/

arXiv技术论文:https://arxiv.org/pdf/2503.08037

ObjectMover能做什么?

特效制作:对于一些复杂的特效场景,如物体的消失或出现,ObjectMover可以实现物体的删除和插入,保持场景的真实感。

虚拟场景编辑:在虚拟现实和游戏开发中,需要对虚拟场景中的物体进行灵活的调整。ObjectMover可以用来移动场景中的物体,如将一个道具从一个位置移动到另一个位置,同时保持物体的光照和阴影与环境一致。

游戏关卡设计:开发者可以用ObjectMover快速调整关卡中的物体布局,提高关卡设计的效率。

产品展示:对于产品广告,可以用ObjectMover将产品放置在不同的场景中,展示产品的不同使用场景。

空间规划:在建筑和室内设计中,可以用ObjectMover将家具或装饰品移动到不同的位置,评估不同的设计方案。

© 版权声明:本站所有原创文章版权均归卓商AI工具集及原创作者所有,未经允许任何个人、媒体、网站不得转载或以其他方式抄袭本站任何文章。
卓商AI
卓商AI

AI爱好者的一站式人工智能AI工具箱,累计收录全球10,000⁺好用的AI工具软件和网站,方便您更便捷的探索前沿的AI技术。本站持续更新好的AI应用,力争做全球排名前三的AI网址导航网站,欢迎您成为我们的一员。

猜你喜欢
  • storymania ai story generator
    storymania ai story generator 与AI -Power的平台与Storymania进行工艺吸引人的故事,旨在协助各个级别的作家。在干净,无广告的环境中享受无缝的编辑和类型定制。在创纪录...
  • frase
    frase Frase是一种强大的AI驱动的SEO内容优化和写作工具,旨在帮助您充分利用内容。通过建议优化的内容想法,标题优化和SEO关键字研究,Frase使创建...
  • namelix
    namelix Namelix是企业家试图找到完美企业名称的理想工具。 Namelix利用人工智能和功能强大的算法,很快就会生成一定肯定会脱颖而出的潜在品牌企业名称的...
  • Exponent
    Exponent Exponent 是一款协作式 AI 编程代理,旨在提升软件开发的效率与体验。它能够在多种环境中工作,从代码的探索到部署,能够帮助开发者自动化复杂的编...
  • Next.js
    Next.js Next.js 是一个用于构建现代 React 应用程序的框架。它提供了许多功能和优势,包括服务器渲染、静态生成、热模块替换等。Next.js 的定价...
  • GPTseek
    GPTseek GPTseek是开发者展示GPT并进行投票的最佳平台,也是社区发现顶级GPT的地方。使用ChatGPT技术,加入我们一起发现顶级GPT!...
  • BetterBody
    BetterBody BetterBody是您的终极营养伙伴,革新了餐饮计划和健康饮食!告别混乱的饮食和拥抱个性化餐饮计划、无缝食品记录和您自己的AI营养师。BetterB...
  • 可灵 AI
    可灵 AI 可灵 AI 是一款集成了 AI 图像和视频创作功能的创意生产力平台。其主要优点在于快速生成多样风格的图片和高清视频,助力用户提升创作效率。产品定位于为...