仿人面部机器人逼真表情学习
CVPR 2027, 已投稿, 2025
摘要
人形面部机器人若要在教育、陪伴和展演等场景中显得亲近可信,需要生成能调动眉眼、唇颊和头颈的全脸
动态表情。现有系统常把机器人脸作为人脸动画的下游执行目标,依赖低维表情参数或像素视频中间量,
从而把表情生成与物理执行割裂开来:前者难以承载同一语音下的多样全脸运动,后者又把真实机器人置
于分布外视觉目标中,并需要再经过提取、平滑和映射才能落到执行器。本文提出一个文本与音频驱动
的高自由度密度仿生机械脸系统。硬件上,柔性腱鞘传动网络将舵机与面部动作点解耦,在仅
研究动机
仿人面部机器人平台常在两个方向上失败:要么动作看起来很机械(物理上可行,但视觉上”死气沉沉”), 要么学出来的控制器为了追求视觉逼真度,把硬件驱动到安全范围之外。我们想要的表情,既要”看起来像 人”,又要”能在真实电机上跑起来”。
硬件平台
贡献
- 高自由度密度仿生机械脸硬件。 构建了一个采用柔性腱鞘传动网络的仿生头部,在 19.5 cm 高的 小型头部空间内集成 34 个舵机执行器,使更接近女性角色比例的亲和外观也能承载细腻的全脸表情。
- 机器人感知的运动潜在接口。 把机器人图像观测纳入运动表征学习,使生成、视觉表演读取与执行 器映射共享同一运动空间,避免把机器人仅仅当作像素视频或 blendshape 管线下游的 retargeting 目标。
- 运动潜在空间内的条件生成。 在 motion latent 中用单一网络支持 T2V、A2V 与 TA2V 三种输入 设置,并提供离线双向 Transformer 与流式自回归两个版本;推理时不经过像素视频中间目标,因此 避免了视频伪影和额外的重建延迟。
- 系统验证。 打通”文本/音频 → 运动潜在 → 虚拟渲染 / 执行器”的完整链路,在生成质量、可控性、 跨表演者一致性与机器人部署上给出实验验证。机器人端的定量评测(表情识别、唇/情顶点误差、用户 研究)目前以占位结果标注,待真机闭环实验完成后替换。
视频
演示片段
同一网络在纯文本驱动(T2V)下生成的八段短表情,展示细粒度的眉、眼、唇部协同动态。
人脸到机器人表情重定向
同一段人类表演,经运动潜在接口读出后重定向到机械脸执行器。