InstructMove是什么?一文让你看懂InstructMove的技术原理、主要功能、应用场景

来源:卓商AI
发布时间:2025-04-05

InstructMove概述简介

InstructMove是东京大学和Adobe公司联合推出的基于指令的图像编辑模型,通过观察视频中的帧对变化学习如何根据指令进行图像操作。模型基于多模态大型语言大模型(MLLMs)生成描述帧对之间变化的编辑指令,训练出能在保持内容一致性的同时,执行复杂非刚性编辑任务的能力,如调整主体姿势、改变表情和视角等。InstructMove用真实视频帧作为数据源,确保编辑过程中内容的自然性和真实性,克服合成数据集在复杂编辑任务上的局限性。InstructMove支持基于掩码等控制机制进行精确的局部编辑,进一步增强在实际应用中的灵活性和实用性。

InstructMove的功能特色

非刚性编辑:能调整图像中主体的姿势、表情等非刚性特征,符合给定的编辑指令。

视角调整:根据指令改变图像的拍摄视角,如将相机视角向左或向右移动等,改变图像的构图和视觉效果。

元素重新排列:对图像中的元素进行重新排列或移动,如将玩具的腿放在一起、让鸟的尾巴可见等,满足特定的编辑需求。

精确局部编辑:与掩码等控制机制的结合,支持对图像的特定区域进行精确的局部编辑,实现更细致的修改效果。

InstructMove的技术原理

数据集构建

视频帧采样:从互联网视频中采样帧对,确保帧对之间存在有意义的变换,如主体姿势变化、元素移动或相机视角调整等,获取到大量自然且真实的图像变换样本。

多模态语言大模型生成指令:用多模态大型语言大模型(MLLMs),如GPT-4o或Pixtral-12B,分析采样得到的帧对之间的差异,生成准确的编辑指令。

模型架构与训练

预训练模型微调:在构建的数据集上微调预训练的文本到图像(T2I)模型,如Stable Diffusion。

空间条件策略:引入空间条件策略,将参考图像与噪声输入沿空间维度进行拼接,而不是传统的通道拼接。

去噪网络训练:将拼接后的输入送入去噪U-Net网络,预测噪声图。给予计算预测噪声图与原始噪声图之间的差异,优化模型参数,准确地根据编辑指令对目标图像进行去噪和重建,实现图像编辑。

控制机制集成

掩码引导:支持与掩码等控制机制的集成,实现精确的局部编辑。在推理阶段,用掩码控制编辑区域,将更新后的潜在表示与参考潜在表示进行融合,对图像的特定部分进行修改。

其他空间控制:与ControlNet等可控扩散模型集成,接受用户提供的额外视觉线索,如草图或骨架关键点等,实现更复杂和精确的图像编辑操作。

InstructMove项目介绍

项目官网:ljzycmd.github.io/projects/InstructMove

arXiv技术论文:https://arxiv.org/pdf/2412.12087v1

InstructMove能做什么?

影视后期制作:特效师调整科幻电影中外星生物角色的表情,让其更符合剧情要求的愤怒情绪。

广告创意设计:设计师用为汽车广告调整赛车视角和背景元素,突出新车型的速度与激情特点,吸引消费者注意。

室内设计:室内设计师调整卧室床头柜位置和窗帘样式,满足客户对美观和实用性的需求,营造温馨舒适的睡眠环境。

艺术教育:老师在绘画课上调整人物动作,帮助学生理解动作与情感的关系,加深对艺术创作的理解。

个人照片编辑:个人用户调整聚会照片中的表情,使其更自然轻松,分享到社交平台,获得朋友点赞好评。

© 版权声明:本站所有原创文章版权均归卓商AI工具集及原创作者所有,未经允许任何个人、媒体、网站不得转载或以其他方式抄袭本站任何文章。
卓商AI
卓商AI

AI爱好者的一站式人工智能AI工具箱,累计收录全球10,000⁺好用的AI工具软件和网站,方便您更便捷的探索前沿的AI技术。本站持续更新好的AI应用,力争做全球排名前三的AI网址导航网站,欢迎您成为我们的一员。

猜你喜欢
  • Zonos-v0.1
    Zonos-v0.1 Zonos-v0.1 是 Zyphra 团队开发的实时文本转语音(TTS)模型,具备高保真语音克隆功能。该模型包含一个 1.6B 参数的 Transf...
  • GuessAI
    GuessAI 猜猜AI是一款结合艺术和科技的移动游戏。你能分辨出人工制作的绘画和由AI生成的绘画吗?就像使用Tinder应用一样简单。玩起来既轻松又有趣:\n\n-...
  • AI Hear
    AI Hear AI Hear是一款在电脑本地运行的私有软件,它通过一键开启多语种实时翻译功能,帮助用户管理音频、译文和时间轴。产品不收集数据,保护用户隐私。它适用于...
  • infra.new
    infra.new Infra.new 是一款面向云开发运维的AI辅助工具,通过实时成本分析、配置优化和基础设施代码生成等功能,帮助用户高效管理云基础设施。它支持多种云平...
  • wevideo
    wevideo Wevideo是用于学校,企业和企业家的领先的在线视频编辑平台。易于使用的工具可让您创建具有专业结果的惊人多媒体项目。立即开始免费使用#1视频编辑器!...
  • Speek
    Speek Speek是一款AI驱动的助手,通过语音和动画鼠标指针指导用户在网站上的操作,帮助解答问题、引导用户了解网站功能,并简化购买决策。它通过提供实时帮助,...
  • HuatuoGPT-o1-8B
    HuatuoGPT-o1-8B HuatuoGPT-o1-8B 是一个专为高级医疗推理设计的医疗领域大型语言模型(LLM)。它在提供最终响应之前会生成一个复杂的思考过程,反映并完善其...
  • Chopcast
    Chopcast chopcast是一个内容再利用平台,通过使用OpenAI的GPT技术,自动识别关键时刻,设计为适合分享的YouTube Shorts、Reels、T...