在世界机器人大会上,AheadForm 的 Elf-Xuan 2.0 做了一次现场演唱,唇形和表情实时同步,还配了手臂动作。
值得说的是”实时”这两个字。预录的表情动画很好做,难的是在唱的同时把口型、面部肌肉和肢体动作对齐——音素到嘴形的映射有延迟,一旦对不上,观感立刻从”像人”掉进恐怖谷。能在展会这种没有重来机会的场合跑完整首歌,说明这套流水线的延迟已经压到了可用区间。
AheadForm 一直做的是仿生机器人头部,重点在面部表情的细腻度。这类产品目前的应用想象空间集中在几个方向:展陈导览、影视预演、以及陪伴型硬件的头部模块。真正决定它能走多远的不是表情有多逼真,是背后的对话和情感理解能不能跟上——一张会表达的脸,如果说的话很木,反而会把违和感放大。
这两年国内的仿生头部和整机人形分成了两条挺不一样的路。人形机器人卷的是运动控制和负载,仿生头部卷的是表情和交互,前者的买家是工厂,后者的买家是场景和内容方。
现场演唱这种 demo 的说服力有限,但它至少证明了一件事:延迟这个老大难,正在被解决。
© 版权声明
文章版权归作者所有,未经允许请勿转载。






世界机器人大会上,AheadForm 的仿生头部现场唱了一首歌