news 2026/8/21 15:59:23

项目分享|MimicMotion:基于置信度姿态引导的高质量人体运动视频生成

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
项目分享|MimicMotion:基于置信度姿态引导的高质量人体运动视频生成

项目简介

MimicMotion是一款专注于高质量人体运动视频生成的可控视频生成框架,由腾讯与上海交通大学的团队合作研发,相关成果已被ICML 2025收录。

该框架能够在任意运动引导下,生成高质量且长度任意的视频。从展示的示例来看,生成的视频具有丰富的细节、良好的 temporal 平滑性以及较长的视频长度。

在版本更新方面,2024年7月1日发布了项目页面、代码、技术报告及基础模型 checkpoint,7月8日发布了更优的1.1版本模型 checkpoint,将最大视频帧数从16扩展到72,显著提升了视频质量。

创新点与核心优势

MimicMotion相比以往方法,具有多项突出的创新点和优势:

其一,采用置信度感知的姿态引导,不仅实现了时间上的平滑性,还借助大规模训练数据增强了模型的鲁棒性。这使得生成的视频在运动连贯性上表现出色,减少了画面的突兀感。

其二,基于姿态置信度的区域损失放大,大幅减轻了图像的失真问题,让生成的视频画面更保真,细节更清晰。

其三,为生成 long and smooth 的视频,提出了渐进式潜在融合策略。通过这种方式,能够在可接受的资源消耗下生成任意长度的视频,突破了以往视频生成在长度上的限制。

通过大量实验和用户研究表明,MimicMotion在多个方面相比以往方法都有显著提升。

技术原理与部署指南

技术原理概述

MimicMotion的框架围绕着实现高质量人体运动视频生成展开,其核心在于通过置信度感知的姿态引导、区域损失放大以及渐进式潜在融合策略等技术,解决视频生成中可控性、视频长度、细节丰富度等问题。这些技术相互配合,共同提升了视频生成的质量和性能。

环境搭建

推荐使用Python 3+和PyTorch 2.x,已在Nvidia V100 GPU上验证。可通过以下命令安装依赖:

conda env create -f environment.yaml conda activate mimicmotion

权重下载

若连接Hugging Face存在问题,可设置环境变量export HF_ENDPOINT=https://hf-mirror.com。具体下载步骤如下:

  1. 下载DWPose预训练模型:
mkdir -p models/DWPose wget https://huggingface.co/yzd-v/DWPose/resolve/main/yolox_l.onnx?download=true -O models/DWPose/yolox_l.onnx wget https://huggingface.co/yzd-v/DWPose/resolve/main/dw-ll_ucoco_384.onnx?download=true -O models/DWPose/dw-ll_ucoco_384.onnx
  1. 从Huggingface下载MimicMotion的预训练checkpoint:
wget -P models/ https://huggingface.co/tencent/MimicMotion/resolve/main/MimicMotion_1-1.pth
  1. SVD模型stabilityai/stable-video-diffusion-img2vid-xt-1-1会自动下载。

最终权重应按如下结构组织:

models/ ├── DWPose │ ├── dw-ll_ucoco_384.onnx │ └── yolox_l.onnx └── MimicMotion_1-1.pth

模型推理

提供了test.yaml作为测试的示例配置,可根据需求修改。运行以下命令进行推理:

python inference.py --inference_config configs/test.yaml

若GPU内存有限,可尝试设置环境变量PYTORCH_CUDA_ALLOC_CONF=max_split_size_mb:256

显存需求与运行时间

35秒的演示视频,72帧模型需要16GB显存(4060ti),在4090 GPU上需20分钟完成。16帧U-Net模型最低显存需求为8GB,但VAE解码器需要16GB,也可选择在CPU上运行VAE解码器。

该项目及相关内容已在AladdinEdu课题广场同步发布,欢迎前往了解更多技术实现与资源!

项目地址:AladdinEdu课题广场

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/8/21 9:58:17

学术探索新利器:书匠策AI解锁本科硕士论文写作“超能力”

在学术的浩瀚海洋中,每一位本科生和硕士生都是勇敢的航海家,怀揣着对知识的渴望和对真理的追求,不断探索未知的领域。然而,面对堆积如山的文献资料、错综复杂的逻辑框架以及繁琐的格式调整,不少学子常常感到力不从心。…

作者头像 李华
网站建设 2026/8/21 6:53:54

Langchain-Chatchat结合Prompt模板提升一致性

Langchain-Chatchat 结合 Prompt 模板提升一致性 在企业知识管理日益复杂的今天,如何让大模型“说对话”,成了智能系统落地的关键挑战。通用语言模型虽然见多识广,但面对公司内部的制度流程、产品手册或技术文档时,常常答非所问&a…

作者头像 李华
网站建设 2026/8/21 23:00:49

Langchain-Chatchat问答系统压力测试结果公布

Langchain-Chatchat 问答系统压力测试深度解析 在企业智能化转型的浪潮中,如何让 AI 真正“懂自己”成了关键挑战。通用大模型虽然强大,但在面对公司内部制度、产品手册或客户合同这类私有知识时,往往显得力不从心——要么答非所问&#xff0…

作者头像 李华
网站建设 2026/8/21 23:40:28

深度学习模型性能分析利器:Calflops全方位解析

深度学习模型性能分析利器:Calflops全方位解析 【免费下载链接】calculate-flops.pytorch The calflops is designed to calculate FLOPs、MACs and Parameters in all various neural networks, such as Linear、 CNN、 RNN、 GCN、Transformer(Bert、LlaMA etc La…

作者头像 李华
网站建设 2026/8/21 2:41:58

Next Best Sense:利用FisherRF引导视觉与触觉的主动3D高斯泼溅重建

来源:Green生态智能机器人 「3D视觉从入门到精通」知识星球(点开有惊喜) !星球内新增20多门3D视觉系统课程、入门环境配置教程、多场顶会直播、顶会论文最新解读、3D视觉算法源码、求职招聘等。想要入门3D视觉、做项目、搞科研,欢迎扫码加入&…

作者头像 李华
网站建设 2026/8/20 5:26:05

CUT3R实时三维感知模型:从入门到精通的完整指南

CUT3R实时三维感知模型:从入门到精通的完整指南 【免费下载链接】CUT3R Official implementation of Continuous 3D Perception Model with Persistent State 项目地址: https://gitcode.com/gh_mirrors/cu/CUT3R CUT3R(Continuous 3D Perception…

作者头像 李华