苏姿丰:AMD RX 9070 XT 显卡首周销量历史最佳,比上代增长 10 倍库克再次现身苹果三里屯零售店阿里蔡崇信:数据中心建设领域需警惕可能正在形成潜在的泡沫苹果首席运营官杰夫.威廉姆斯:中国是特别重要的市场,将继续进行大规模投资美团 CEO 王兴再次减持理想汽车股权,四个交易日套现约 7 亿港元云服务商 GoDaddy 曝光黑客利用 DollyWay 恶意软件劫持 WordPress 站点,波及 2 万网站中消协建议消费者“非必要不开启免密支付”,易成不法分子盗刷漏洞比亚迪2024年收入7771亿元,已布局AI机器人业务透视地平线2024财报:业绩高增长,智驾平权的“幕后推手”日本七大车企业绩持续下滑?日系车这到底是怎么了?“最强”小米,不够“惊喜”快手公布2024年成绩单:全年经调整净利润同比增长72.5%积木易搭携智慧文博整体解决方案亮相2025新疆旅交会暨第二届新疆博博会,全面助力文博机构数字化升级突破大厂封锁,中小游戏团队靠AI逆袭?Cloudflare 推出 AI Labyrinth 功能:以 AI 生成内容对抗 AI 爬虫福州地铁联合支付宝推出同行乘车码服务,1 部手机同一账号可供 3 人刷码过闸首款天玑9400+高性价比机型!真我GT7最快4月登场OPPO Find X8 Ultra参数出炉:最强2K直屏Ultra手机勇闯电竞圈,小红书急于拓宽的边界格力称从未生产和销售999元电动车 目前没有相关业务规划
  • 首页 > 企业IT频道 > 软件即服务

    谷歌发布多模态直播 API:解锁看、听、说,开启 AI 音视频交互新体验

    2024年12月13日 10:39:53   来源:IT之家

      谷歌昨日在发布 Gemini 2.0 的同时,还发布了全新的多模态直播(Multimodal Live)API,帮助开发人员开发具有实时音频和视频流功能的应用程序。

      该 API 实现了低延迟、双向的文本、音频和视频交互,以音频和文本形式输出,带来更自然流畅、如同人类对话般的交互体验。用户可以随时打断模型,并通过共享摄像头输入或屏幕录像与其进行互动,就内容提问。

      该模型的视频理解功能扩展了通信模式,用户能够使用摄像头实时拍摄或共享桌面并提出相关问题。该 API 已经向开发者开放,同时也向用户提供了一个多模态实时助手的演示应用。

      该 API 支持集成多种工具,开发者只需一次 API 调用,即可完成复杂的用例。

      文章内容仅供阅读,不构成投资建议,请谨慎对待。投资者据此操作,风险自担。

    即时

    新闻

    明火炊具市场:三季度健康属性贯穿全类目

    奥维云网(AVC)推总数据显示,2024年1-9月明火炊具线上零售额94.2亿元,同比增加3.1%,其中抖音渠道表现优异,同比有14%的涨幅,传统电商略有下滑,同比降低2.3%。

    企业IT

    重庆创新公积金应用,“区块链+政务服务”显成效

    “以前都要去窗口办,一套流程下来都要半个月了,现在方便多了!”打开“重庆公积金”微信小程序,按照提示流程提交相关材料,仅几秒钟,重庆市民曾某的账户就打进了21600元。

    3C消费

    华硕ProArt创艺27 Pro PA279CRV显示器,高能实力,创

    华硕ProArt创艺27 Pro PA279CRV显示器,凭借其优秀的性能配置和精准的色彩呈现能力,为您的创作工作带来实质性的帮助,双十一期间低至2799元,性价比很高,简直是创作者们的首选。