LHM是什么?一文让你看懂LHM的技术原理、主要功能、应用场景

来源:卓商AI
发布时间:2025-04-05

LHM概述简介

LHM(Large Animatable Human Reconstruction Model)是阿里巴巴通义实验室推出的从单张图像重建可动画化3D人体模型。基于多模态Transformer架构,融合3D几何特征和2D图像特征,用注意力机制保留服装几何与纹理细节,推出头部特征金字塔编码方案增强面部细节恢复能力。LHM用3D高斯点云(Gaussian Splatting)形式表示重建的3D模型,支持实时渲染和姿态控制动画。模型能在几秒内生成高质量的可动画化3D人体模型,适用于AR/VR等沉浸式应用。

LHM的功能特色

快速重建:在几秒钟内完成从单张图像到3D可动画化模型的转换,无需复杂的后处理。

高保真细节:精确保留服装纹理、面部细节等关键信息,生成高质量的3D模型。

实时动画:支持基于姿态控制的实时动画渲染,适用于沉浸式应用(如AR/VR)。

泛化能力强:在开放环境(in-the-wild images)上表现出色,适应多种场景和姿态。

LHM的技术原理

多模态Transformer架构:基于Transformer架构融合3D几何特征(从SMPL-X模板采样得到的表面点)和2D图像特征(从预训练的视觉Transformer提取),有效处理几何和视觉信息。针对头部区域设计的多尺度特征提取方案,聚合不同层次的特征增强面部细节的恢复能力。

3D高斯点云表示:基于3D高斯点云(Gaussian Splatting)表示3D模型,支持实时、高质量的渲染。网络直接预测高斯点云的参数(如位置、旋转、缩放、颜色等),实现从输入图像到3D模型的快速转换。

自监督学习:基于大规模视频数据进行训练,用渲染损失和正则化项优化模型,无需依赖稀缺的3D扫描数据。在训练过程中,引入“尽可能接近”(as close as possible)和“尽可能接近球形”(as spherical as possible)的正则化项,保持3D模型的几何合理性。

实时动画支持:基于SMPL-X骨架参数将重建的3D模型变形到目标姿态,支持实时姿态控制动画。整个重建和动画化过程在单次前向传播中完成,适合实时应用。

LHM项目介绍

项目官网:https://lingtengqiu.github.io/LHM/

GitHub仓库:https://github.com/aigc3d/LHM

arXiv技术论文:https://arxiv.org/pdf/2503.10625

在线体验Demo:https://huggingface.co/spaces/DyrusQZ/LHM

LHM能做什么?

虚拟现实(VR)和增强现实(AR):快速将照片转化为可动画化的3D虚拟角色,增强沉浸感和交互性。

游戏开发:快速生成高质量3D角色模型,支持实时动画,提升开发效率和游戏体验。

影视制作:用在特效制作和动画电影,快速生成角色模型,提升制作效率和质量。

社交媒体和内容创作:用户可生成3D虚拟形象用于社交媒体,创作者可快速生成3D角色用于短视频等。

教育和培训:创建虚拟教师或助教用于在线教育,生成3D模型用于医疗、军事等领域的模拟训练。

© 版权声明:本站所有原创文章版权均归卓商AI工具集及原创作者所有,未经允许任何个人、媒体、网站不得转载或以其他方式抄袭本站任何文章。
卓商AI
卓商AI

AI爱好者的一站式人工智能AI工具箱,累计收录全球10,000⁺好用的AI工具软件和网站,方便您更便捷的探索前沿的AI技术。本站持续更新好的AI应用,力争做全球排名前三的AI网址导航网站,欢迎您成为我们的一员。

猜你喜欢
  • 百宝箱Tbox
    百宝箱Tbox Tbox 是一款基于支付宝生活场景的大模型技术产品,旨在为企业快速构建专业级智能体,助力业务增长。它融合了蚂蚁百灵大模型、蚁天鉴、灵境数字人等先进技术...
  • writeany
    writeany Writeany提供了一种针对横幅广告性能和会员货币化量身定制的AI动力写作工具。该产品减轻了内容的麻烦,可以节省您的时间,金钱和精力。通过Write...
  • easegen-admin
    easegen-admin easegen-admin是一个开源的数字人课程制作平台,旨在通过开源为AI发展做出贡献。该平台前端基于Vue3 + element-plus实现,后...
  • Reiden
    Reiden Reiden是一个AI生产力助手,旨在通过智能推荐键盘快捷键来提高用户的工作效率。它在后台运行,实时分析用户的工作效率,并根据用户的工作习惯提供个性化...
  • GibberLink
    GibberLink GibberLink是一个基于ggwave数据传输协议的AI通信模型。它允许两个独立的AI代理在对话中识别彼此为AI后,从英语切换到声音级协议进行通信...
  • Mobile-Agent-E
    Mobile-Agent-E Mobile-Agent-E 是一款基于大型多模态模型(LMM)的移动助手,旨在帮助用户高效完成复杂的多步骤任务。它通过分层多智能体框架实现自我进化,...
  • Your Music Taste Sucks
    Your Music Taste Sucks Your Music Taste Sucks是一款基于人工智能的音乐品味评估网站。用户可以上传自己喜欢的音乐,AI会根据用户上传的音乐评估用户的音乐品...
  • Viqal
    Viqal Viqal是一款由 ChatGPT 提供支持的自动客户通信工具。我们领先的人工智能虚拟助手提高员工效率,提升客户体验。功能包括:全自动对话与数据录入、...