字号
本期编译精选。
Meta正与Muse Voice Trancis进入竞争日益激烈的实时语音对文本市场,这是一种新的音频感知模式,它结合了流音转录,端点检测和对20多位发言者的扬声器对接——公开的API价格仅为每小时0.18美元。由Meta Superintelligence Labs所开发,Muse的设计是在语音发生时处理语音,而不是等待录音完成。Meta为Muse Voice Translatis的发帖称,该模型支持一个小时以上的长音频,无缝多语种代码交换,语言和关键词偏差,以及没有单独处理后管道的对等化。该模式经过了超过70种语言的培训,有25种经过广泛验证后可以首次发布。20多语种的数字是实质性的,但不是世界纪录。对目前供应商文件的审查使公布的上限提高。Speechmatics的实时收音机服务说,它可以默认识别出50个发音,在加限时最多可识别出100个发音,而Amazon Translax的Diarvision文件则规定最多可识别出30个独有发音,包括流传收音机收音机。(演讲) 不过,Muse土地走向市场高端,而Meta的更广泛主张可以说比原始最大值更重要:高容量实时对接,加上低纬度的转录、端点、多语种代码切换和在同一模式中积极的API定价。对于建立会议系统的企业开发者来说,叫分析师、现场助理或环境AI,这种组合可能比谁拥有发言记录更重要。传统语音识别回答一个相对简单的问题:刚才说什么?日记又说:谁说的?随着记录为下游人工智能系统提供信息,这种区分变得至关重要。一个会议助理可以正确t
(编译自 VentureBeat;原文
来源:VentureBeat(原文)
本文系本站对该英文资讯的编译与转述,非全文翻译;版权归原作者所有。
本文系本站对该英文资讯的编译与转述,非全文翻译;版权归原作者所有。
免费订阅
每天 5 分钟,看懂世界在发生什么
订阅「牛金金天天译站」,每日精选海外科技/AI/文化资讯编译送到你邮箱。非经营性、无广告、可随时退订。
评论