7 月20日,阿里巴巴发布语音合成大模型Qwen-Audio-3.0-TTS,在细粒度标签控制、freestyle指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面系统性提升,包含面向实时交互的Flash版本(首包延时300ms级别)和面向高质量生成的Plus版本,让合成语音从“能说话”走向“会表达”。目前,在全球第三方权威榜单Artificial Analysis,Qwen-Audio-3.0- ...
WAIC系列|阿里发布Qwen-Audio-3.0-TTS,语音合成迈向“会表达”时代,马来语,韩语,tts,audio,qwen,方言 ...
阿里发布新一代语音识别大模型 Qwen-Audio-3.0-ASR-Flash,重点优化了专业词汇的识别表现。该模型已在医疗等垂直场景中展现出较高准确率,相关听写准确率突破九成五。 语音识别在通用对话中已相对成熟,但在医学、法律、工业等专业领域,由于术语密集且发音相近词多,模型常常出现误判。此次新模型强化了对专业词的处理能力,使其更贴合真实行业场景的需求。
Following last week’s announcement, the Google News Audio Briefing is beginning to roll out on Android. Google has a new pilot program with news publishers around the world to “explore how AI can help ...
IT之家7 月 15 日消息,阿里巴巴实时语音交互对话模型 Qwen-Audio-3.0-Realtime 今天(15 日)正式发布,在智商、Agent 工具调用、共情对话和双工交互流畅度四条主线上同步升级,力求“又快又聪明”。 模型包括推理更强的 Plus 版本和速度更快的 Flash 版本,适用于智能客服、教育培训、娱乐互动与情感陪伴等场景。官方表示,该模型将让语音交互“懂倾听,更聪明”。 针 ...
IT之家7 月 31 日消息,阿里巴巴今日发布语音识别大模型 Qwen-Audio-3.0-ASR-Flash。简单来说,就是让 AI 更好地听懂专业词汇。 Qwen-Audio-3.0-ASR-Flash 主要在上下文一致性、行业词识别和热词定制化三个维度做了系统性的优化,同时让模型具备语音润色能力,可直接输出结构化文本。 研究团队持续从医疗、IT 编程、股票、社会名人等领域里挖掘专业词汇,建成 ...
IT之家 7 月 20 日消息,字节跳动 Seed 官方今日发布了音频创作模型 Seed Audio 1.0,面向完整声音场景,在统一框架下联合建模人声、音效和环境声等多种音频要素,端到端完成影视级音频创作。 官方宣称,声音不再只是画面的补充,而是可以直接参与叙事,在听者脑海中直接形成画面感,做到“听见”即“看见”,其核心能力主要体现在以下方面: 据介绍,在文本生成音色能力上,Seed Audio ...
近日,世界超高清视频产业联盟(UWA联盟)菁彩声Audio Vivid生态迎来规模化落地重磅进展。在UWA联盟、腾讯音乐娱乐集团(TME)与HarmonyOS的携手合作下,鸿蒙版QQ音乐于6月10日正式上线搭载Audio Vivid技术的臻品全景声3.0功能;鸿蒙版酷狗音乐则将于6月12日正式接入,同步上线AI ...
Monitor Audio宣布,旗下旗舰扬声器Hyphn——该公司历史上技术最具雄心的产品之一——现已推出超过200种定制饰面。每只定制Hyphn扬声器均在英国手工喷漆和组装,并根据客户需求量身打造,让用户能够自由选择与任何室内聆听环境完美契合的饰面。这款扬声器是Monitor Audio历经多年研发的成果,最初作为公司50周年庆典的概念产品亮相,如今已成为现实。 Monitor Audio 最初 ...
一些您可能无法访问的结果已被隐去。
显示无法访问的结果