← 返回

仿人面部机器人逼真表情学习

Yongji Fu, Rui Zhang, Zhenyu Xu, et al.

CVPR 2027, 已投稿, 2025

摘要

人形面部机器人若要在教育、陪伴和展演等场景中显得亲近可信,需要生成能调动眉眼、唇颊和头颈的全脸 动态表情。现有系统常把机器人脸作为人脸动画的下游执行目标,依赖低维表情参数或像素视频中间量, 从而把表情生成与物理执行割裂开来:前者难以承载同一语音下的多样全脸运动,后者又把真实机器人置 于分布外视觉目标中,并需要再经过提取、平滑和映射才能落到执行器。本文提出一个文本与音频驱动 的高自由度密度仿生机械脸系统。硬件上,柔性腱鞘传动网络将舵机与面部动作点解耦,在仅 cm 高的亲和型头部内集成 个舵机执行器。算法上,我们学习机器人感知的运动潜在 接口,并直接在该空间生成全脸运动,使文本控制情绪与动作语义,音频约束唇形同步,机器人图像 观测锚定真实硬件。该系统避免推理时先生成像素视频或重建机器人脸图像,减少中间伪影和额外延迟。 实验表明,本系统能够生成自然、可控的说话表情,并为跨表演者稳定的机器人表情驱动提供统一接口。

研究动机

仿人面部机器人平台常在两个方向上失败:要么动作看起来很机械(物理上可行,但视觉上”死气沉沉”), 要么学出来的控制器为了追求视觉逼真度,把硬件驱动到安全范围之外。我们想要的表情,既要”看起来像 人”,又要”能在真实电机上跑起来”。

硬件平台

绳腱密集仿生机械脸硬件平台
绳腱密集仿生机械脸硬件平台。 (a) 正视图;(b) 透明外壳侧视图,可见集中布置于颅壳的舵机库与经铜管走向面部的钢丝腱;(c)(d) 左右 3/4 视图。颈部由两台无刷电机经双推杆(两端鱼眼球铰)与 yaw 齿轮副驱动。

贡献

  • 高自由度密度仿生机械脸硬件。 构建了一个采用柔性腱鞘传动网络的仿生头部,在 19.5 cm 高的 小型头部空间内集成 34 个舵机执行器,使更接近女性角色比例的亲和外观也能承载细腻的全脸表情。
  • 机器人感知的运动潜在接口。 把机器人图像观测纳入运动表征学习,使生成、视觉表演读取与执行 器映射共享同一运动空间,避免把机器人仅仅当作像素视频或 blendshape 管线下游的 retargeting 目标。
  • 运动潜在空间内的条件生成。 在 motion latent 中用单一网络支持 T2V、A2V 与 TA2V 三种输入 设置,并提供离线双向 Transformer 与流式自回归两个版本;推理时不经过像素视频中间目标,因此 避免了视频伪影和额外的重建延迟。
  • 系统验证。 打通”文本/音频 → 运动潜在 → 虚拟渲染 / 执行器”的完整链路,在生成质量、可控性、 跨表演者一致性与机器人部署上给出实验验证。机器人端的定量评测(表情识别、唇/情顶点误差、用户 研究)目前以占位结果标注,待真机闭环实验完成后替换。

视频

演示片段

同一网络在纯文本驱动(T2V)下生成的八段短表情,展示细粒度的眉、眼、唇部协同动态。

快速眨眼,显得略微紧张
露出浅浅的微笑,随即迅速淡去转为略显严肃
轻轻眯眼并望向别处,显得有点不耐烦
轻轻挑起一边眉毛并微启双唇
柔和地微笑并俏皮地扬起眉毛
歪着头,露出一丝怀疑的神情
微微歪头,同时好奇地扬起眉毛
微微张开嘴,神情透着轻柔的惊叹

人脸到机器人表情重定向

同一段人类表演,经运动潜在接口读出后重定向到机械脸执行器。

人脸表演读出的运动潜在,重定向到机械脸执行器指令,逐帧驱动真实硬件。