ITBear旗下自媒体矩阵:

谷歌推出GNM模型:数字人类头部告别“空壳”,实现内外精细建模

   时间:2026-08-06 05:17:25 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

谷歌研究团队近日发布了一项突破性成果——名为GNM(Generative aNthropometric Model,生成式人体测量模型)的全新参数化头部建模技术。该模型通过整合牙齿、舌头及眼球等内部结构的参数化控制,首次实现了数字人类头部从“表面面具”到“完整解剖体”的跨越。相关研究以预印本形式公开,论文编号为arXiv:2607.23687v1,完整技术报告及开源代码可通过指定渠道获取。

传统三维人脸模型如FLAME、BFM等,虽能通过调整参数生成多样化面孔,却始终存在一个致命缺陷:它们将头部视为实心外壳,仅关注皮肤、骨骼等外部轮廓,而忽略了口腔内部的牙齿、舌头及眼球的复杂结构。当角色张嘴大笑、说话或镜头聚焦眼部特写时,这些模型生成的画面往往因缺乏细节而显得僵硬,甚至引发“恐怖谷效应”——即因细微不自然感引发人类大脑的强烈排斥反应。GNM的诞生正是为了填补这一空白,其目标是将数字头部的真实度提升至“基因级”重建水平。

GNM的核心创新在于构建了一套覆盖全头部的参数化体系。该模型由17821个顶点组成的三维网格构成,涵盖皮肤、牙齿、舌头及眼球的完整几何形状。其参数分为两大类:253个维度的“身份参数”控制面部基本形态(如鼻梁高度、颧骨宽度),382个维度的“表情参数”则驱动表情变化(如嘴角上扬、眼球转动)。模型还包含4个关节旋转角度(控制脖子、头部及眼球转动)及全局位置参数。通过将参数进一步拆解为对应不同解剖区域的子空间(如牙齿形状占80个维度、舌头运动占31个维度),GNM实现了局部独立控制,避免了传统模型中“牵一发而动全身”的僵硬问题。

为支撑这一复杂体系,研究团队搭建了一套高精度多视角人脸扫描系统。该系统配备22台6144×4096像素工业相机及14盏可编程灯光,以弧形阵列覆盖150度水平视角及60度垂直视角。5000余名来自不同性别、年龄(15-84岁)及族裔(白人38%、东亚24%、南亚14%、黑人8%等)的志愿者参与数据采集,每人需完成约150,000个表情样本,涵盖从基本情绪到舌头运动、下颌侧移等十大类动作。为高效处理海量数据,团队开发了并行化流水线,实现每日约一万个样本的自动化重建与质检。

数据配准是GNM开发的另一大挑战。由于不同人的面部结构差异显著,需将所有扫描数据的网格拓扑统一至同一标准(如第1234号顶点对应鼻尖)。研究团队借鉴FLAME模型的迭代协同配准思路,通过“模型-数据”交替优化的方式逐步提升精度。具体而言,先用当前模型拟合扫描数据,再利用物理可微分渲染器(基于Mitsuba引擎)对比渲染图像与实际图像的差异,指导顶点偏移调整。针对牙齿、舌头等易遮挡区域,团队依赖关键点坐标而非像素匹配进行配准;对于颅骨后方等不可见区域,则通过“跨域潜空间回归”策略,利用艺术家制作的辅助模型推断合理形状并融合至原始数据中。

牙齿建模是GNM的亮点之一。由于直接扫描真人牙齿存在技术障碍(如嘴唇遮挡、内部几何复杂),团队采用“艺术家+程序化生成”路线:先由艺术家制作通用牙齿模板并为每颗牙齿设计绑定骨骼,再通过随机调整大小、形状、排列等参数生成5000套合成牙列数据。经主成分分析后,这些数据被压缩为80个基向量,构成身份参数中的牙齿子空间。调整这些参数可生成门牙宽窄、牙缝大小等真实人类牙列变化。舌头建模则更为复杂,团队结合舌头运动序列、外部皮肤几何形状及稀疏三维关键点数据,通过绑定骨骼系统与曲率约束生成2500个姿态样本,最终提取31个基向量描述舌头运动。

眼球建模方面,GNM突破了传统模型将眼球简化为单一球体的局限。真实眼球由巩膜(眼白)与角膜(覆盖瞳孔和虹膜)两个弧度不同的球面组成,角膜的弧度直接影响光线反射形成的“角膜光斑”位置——这是眼部追踪技术的关键特征。GNM采用“双球模型”,固定巩膜半径(约14.6毫米),而角膜半径(均值8.5毫米)和角巩膜缘半径(均值6.0毫米)则根据生理统计数据变化。通过采样10,000个参数组合生成二维眼球截面轮廓线,再映射至三维网格,团队仅用3个参数便实现了眼球形状的精确控制。模型还单独设计了1个表情参数控制瞳孔扩张(范围-3至+3),模拟光照或情绪变化对瞳孔大小的影响。

在性能评估中,GNM展现出显著优势。以15,000张未参与训练的真实人脸扫描为测试集,GNM的平均重建误差为0.748毫米,较FLAME的0.971毫米降低约23%;误差标准差也从0.734毫米降至0.529毫米,表明其稳定性更强。这种改进在不同面部区域(如额头、鼻子、嘴唇)、人群(性别、年龄、族裔)及表情类型(综合表情、下颌运动、嘴唇运动)中均保持一致。随机生成身份的评估显示,GNM生成的头部与真实人脸的距离更近,说明其参数空间被更好地约束在合理解剖范围内。

GNM的应用场景广泛。研究团队开发了图像拟合流水线,可从单张照片或视频中重建三维头部几何:通过预测约600个面部关键点坐标,优化GNM参数使模型投影与关键点重合,同时利用解剖约束防止皮肤与口腔结构穿插。在合成图像、多视角视频及真实场景图像的测试中,GNM均表现出比FLAME更强的表达能力,尤其在处理张嘴露齿、舌头伸出等极端表情时优势明显。模型还配备了“语义采样器”,通过条件变分自编码器将“男性”“东亚人”“开心表情”等高层语义属性映射为具体参数,使非专业用户也能轻松生成高质量数字头部。

目前,GNM的完整框架已开源,供学术研究及商业应用免费使用。研究团队透露,下一步将开放用于面部追踪的密集关键点数据集,并探索将GNM与扩散模型、高斯泼溅等神经渲染技术结合,以进一步突破“恐怖谷效应”。尽管语义采样器的族裔分类(仅含中东、亚洲、黑人、白人四类)及性别分类(仅男、女两类)存在局限性,可能引发偏见问题,但团队已明确提醒用户审慎考虑其在生成任务中的公平性与代表性影响。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version