Hallo3是什么?一文让你看懂Hallo3的技术原理、主要功能、应用场景

来源:卓商AI
发布时间:2025-04-05

Hallo3概述简介

Hallo3是复旦大学和百度公司联合推出的,基于扩散变换器网络(Diffusion Transformer Networks)的肖像图像动画技术,能生成高度动态和逼真的视频。Hallo3基于预训练的变换器视频生成模型,有效解决现有方法在处理非正面视角、动态对象渲染和生成沉浸式背景方面的挑战。Hallo3基于新的视频骨干网络,设计身份参考网络确保视频序列中面部身份的一致性,研究了语音音频条件和运动帧机制,实现由语音音频驱动的连续视频生成。实验表明,Hallo3在生成具有多种方向的逼真肖像方面表现出色,能适应复杂姿势和动态场景,产生逼真且平滑的动画效果。

Hallo3的功能特色

多视角动画生成:从不同的视角(如正面、侧面、 overhead 或低角度)生成动画肖像,突破传统方法主要依赖正面视角的限制。

动态对象渲染:处理肖像周围动态对象的动画,如人物手持智能手机、麦克风或佩戴紧密贴合的物品,生成对象在视频序列中的真实运动。

沉浸式背景生成:生成具有动态效果的背景,如前景中的篝火或背景中的拥挤街道场景,增强视频的真实感和沉浸感。

身份一致性保持:在整个视频序列中保持肖像的身份一致性,在长时间的动画中也能准确地识别和保持人物的面部特征。

语音驱动的动画:基于语音音频驱动肖像的面部表情和嘴唇动作,实现高度同步的语音和面部动画,让动画更加自然和逼真。

Hallo3的技术原理

预训练的变换器视频生成模型:

基础架构:CogVideoX模型作为基础架构,用3D变分自编码器(VAE)对视频数据进行压缩。模型将潜在变量与文本嵌入相结合,基于专家变换器网络进行处理。

条件机制:引入三种条件机制:文本提示(ctext)、语音音频条件(caudio)和身份外观条件(cid)。主要用交叉注意力(cross-attention)和自适应层归一化(adaLN)整合这些条件信息。

身份参考网络:

3D VAE和变换器层:用因果3D VAE结合42层变换器层的身份参考网络,从参考图像中提取身份特征,嵌入到去噪潜在代码中,基于自注意力机制增强模型对身份信息的表示和长期保持。

特征融合:将参考网络生成的视觉特征与去噪网络的特征进行融合,确保生成的面部动画在长时间序列中保持一致性和连贯性。

语音音频条件:

音频嵌入:wav2vec框架提取音频特征,生成帧特定的音频嵌入,基于线性变换层将音频嵌入转换为适合模型的表示。

交叉注意力机制:在去噪网络中,交叉注意力机制将音频嵌入与潜在编码进行交互,增强生成输出的相干性和相关性,确保模型有效地捕捉驱动角色生成的音频信号。

视频外推:引入运动帧作为条件信息。将生成视频的最后几帧作为后续片段生成的输入,用3D VAE处理运动帧,生成新的潜在代码,实现时间一致的长视频推理。

训练和推理:

训练过程:分为两个阶段。第一阶段训练模型生成具有身份一致性的视频;第二阶段扩展到音频驱动的视频生成,整合音频注意力模块。

推理过程:模型接收参考图像、驱动音频、文本提示和运动帧作为输入,生成具有身份一致性和嘴唇同步的视频。

Hallo3项目介绍

项目官网:https://fudan-generative-vision.github.io/hallo3

GitHub仓库:https://github.com/fudan-generative-vision/hallo3

HuggingFace模型库:https://huggingface.co/fudan-generative-ai/hallo3

arXiv技术论文:https://arxiv.org/pdf/2412.00733

Hallo3能做什么?

游戏开发:为游戏中的角色生成动态的肖像动画,使角色在游戏中的表现更加自然和逼真,提升玩家的游戏体验。

电影制作:生成逼真的角色动画,提升电影和动画的视觉效果和沉浸感。

社交媒体:为社交媒体用户生成动态头像,使用户的个人资料更加生动有趣,提升用户在社交媒体上的个性化体验。

在线教育:生成虚拟讲师的动画,让在线课程更加生动和有趣,提高学生的学习兴趣和参与度。

虚拟现实和增强现实:在VR和AR应用中生成虚拟角色,提供更加逼真的交互体验,增强用户的沉浸感和参与感。

© 版权声明:本站所有原创文章版权均归卓商AI工具集及原创作者所有,未经允许任何个人、媒体、网站不得转载或以其他方式抄袭本站任何文章。
卓商AI
卓商AI

AI爱好者的一站式人工智能AI工具箱,累计收录全球10,000⁺好用的AI工具软件和网站,方便您更便捷的探索前沿的AI技术。本站持续更新好的AI应用,力争做全球排名前三的AI网址导航网站,欢迎您成为我们的一员。

猜你喜欢
  • petal
    petal Petal是一个强大的AI驱动文档分析平台,可链接到您的知识库以获得可靠的答案。另外,您可以训练AI技术来分析您的文档并提高生产率。通过花瓣获得最佳的...
  • AI Chat Bot − Ask Anything
    AI Chat Bot − Ask Anything AI Chat Bot − Ask Anything是一款在苹果应用商店上评分达 4.6 的热门应用,已累计下载量超过 68,000 次。该应用通过提...
  • Data Annotation Platform
    Data Annotation Platform Data Annotation Platform是一个端到端的数据标注平台,允许用户上传计算机视觉数据,选择标注类型,并下载结果,无需任何最低承诺。该...
  • Quit Sugar
    Quit Sugar Quit Sugar是一个帮助用户减少糖分摄入、追踪糖分摄入情况并提供健康建议的应用程序。它通过提供一个集中的平台来跟踪、挑战和学习糖分摄入,帮助用户...
  • AskMetric
    AskMetric AskMetric 是一款全方位的电子商务数据分析工具,通过 AI 技术提供数据可视化、关键词搜索和产品、平台和广告策略推荐等功能。它能够揭示产品指标...
  • Foyr
    Foyr Foyr 是一款专为室内设计师打造的工具,从开始到完成整个室内设计项目只需五分之一的时间。提供从平面图到最终渲染所需的一切功能,让你能在短短几个小时内...
  • Buildin.AI
    Buildin.AI Buildin.AI是一个实时协作平台,支持个人免费使用,也支持团队协作。它集成了笔记、文档、思维导图等多种功能,支持网页、移动设备、Mac和Wind...
  • eskilled ai course creator
    eskilled ai course creator Eskill AI课程创建者赋予教育工作者和内容创建者的能力,并具有用户友好的设计和高级AI功能。通过简化内容开发,可以节省时间和精力,从而使您专注于...