近日,火山语音发布了首位超写实数字员工小灿,在同步推出的首秀TVC中,小灿凭借高效的工作能力以及温暖可人的性格引起多方关注,她的到来将会引领怎样的改变?
善听会说能想:提升工作效率的好帮手
小灿作为火山语音团队联合朝夕光年江南团队共同打造的S级超写实数字人形象,名字源于“火山”两字的结合,拼音“can”在英文中表示“可以、能够”的意思,这也意味着小灿从“出生”就是工作的最佳辅助。虽然加入数字人产品矩阵不久,但小灿同样依托团队长期积累的成熟语音交互技术,具有语音识别、自然语言处理、情感识别等多种功能,传承“善听”、“会说”、“能想”的多重能力,能够做到与用户面对面实时交互来提供更加高效服务。
逼真情感表达:技术与人文兼具
尽管小灿是虚拟数字人,但火山语音团队仍然通过强大的技术能力,帮助TA构筑了从外形、动作到语言、情感交互的超写实形态。外形上,凭借团队3D超写实数字人整套形象设计、资产制作、高成本影视级cg管线视频内容的制作能力,让小灿无论在外形动作,还是面部微表情抑或是皮肤肌理、发丝材质等各方面高度逼真,深度还原了真人影像,改变了大众对数字人的一贯认知。
除却精致的外在,小灿通过火山语音团队丰富且领先的对数字人AI的驱动能力,实现了更加近似真人的口型动作表现。例如AI驱动口型方面,团队通过使用行业领先的非自回归模型的唇形生成网络,合成与输入文本或语音完全匹配的唇形,准确率高达98.55%。
“在AI驱动动作上,我们基于创新的Motion Blening技术,在动作切换时可生成过度帧,使数字人在切换各类动作时不仅可以做到毫秒级切换,还可以做到平滑效果自然无感知。”除此之外还在AI表情口型联合建模,基于语音语义的动作生成即co speech技术上,都有极具前瞻性的预研工作,并已取得阶段性成果,后续将全部应用于数字人视频创作、交互以及直播等场景。
值得提及的是,小灿还具备“一条音频秒级别音色复刻”(zero shot TTS)的能力,可以做到高保真还原真人音色、说话风格以及声学环境等特点,在核心技术架构全自研的基础上,关键指标均保持业界前沿。此外韵律模块基于自回归GPT类大模型,目前训练数据超过20万个小时,架构可扩展性很强,未来预计可支持100万小时以上数据训练;模块支持code-switch,即无论prompt为中文或者英文,都可支持直接输出中文、英文及混合内容。整体来说,小灿无疑是目前数字人研发领域艺术与技术高度融合的产物,但她不仅仅是一个超写实数字人形象,更是高效且有温度解决问题的好帮手。
文章内容仅供阅读,不构成投资建议,请谨慎对待。投资者据此操作,风险自担。
奥维云网(AVC)推总数据显示,2024年1-9月明火炊具线上零售额94.2亿元,同比增加3.1%,其中抖音渠道表现优异,同比有14%的涨幅,传统电商略有下滑,同比降低2.3%。
“以前都要去窗口办,一套流程下来都要半个月了,现在方便多了!”打开“重庆公积金”微信小程序,按照提示流程提交相关材料,仅几秒钟,重庆市民曾某的账户就打进了21600元。
华硕ProArt创艺27 Pro PA279CRV显示器,凭借其优秀的性能配置和精准的色彩呈现能力,为您的创作工作带来实质性的帮助,双十一期间低至2799元,性价比很高,简直是创作者们的首选。