DCAI
DC AI 热点

精选

当前热点完整榜单 →
1马斯克披露AI算力布局:Colossus集群拟部署超百万张英伟达GB300芯片83 热度 ⌁2试图入侵政府与高校网站:OpenAI 智能体4次“失控”行为细节曝光81 热度 ⌁3美国能源部拨款19亿美元支持31个电网升级项目以加速数据中心并网81 热度 ⌁4谷歌支持的Fervo Energy在犹他州Cape Station地热电站实现首次发电79 热度 ⌁5针对长上下文编程优化,Claude Opus 5.5 正式发布75 热度 ⌁
9月25日2026-09-25
arXiv 自然语言处理✦ 精选AI 评分 68/10012:00

研究揭示模型后训练压缩会加剧Whisper语音识别的人口统计学不公平现象

自动语音识别(ASR)模型通常在全精度下接受人口统计公平性审查,但实际生产部署的模型大多经过量化、剪枝和蒸馏等压缩处理。该研究探索了后训练权重压缩是否会重新分配不同人口群体的识别错误负担。在Fair-Speech、Common Voice 25和AfriSpeech-200等数据集上的评测显示,对Whisper-large-v3执行50% Wanda剪枝会显著拉大黑人/非裔与亚裔群体间的词错误率差距,表明压缩会复合加剧时间成本与识别公平性差异。

阅读原文 ↗推荐理由:探讨了模型压缩对语音识别公平性的负面影响,为生产端模型的安全治理与伦理审计提供了实证参考。# Whisper# 模型压缩# AI公平性# 语音
arXiv 自然语言处理✦ 精选AI 评分 65/10012:00

孟加拉语长文本语音合成数据集BanglaKontho发布

针对孟加拉语在神经文本转语音(TTS)领域缺乏高质量长文本朗读资源的现状,研究人员推出了BanglaKontho数据集。该数据集源自专业有声读物录音,包含20小时单人发音数据、7050条经转写校验的24 kHz切分片段,旨在解决现有语料缺乏长文本韵律与连贯叙述的问题。此外,研究团队还发布了支持孟加拉风格数字分组、货币与日期表达的文本正则化工具。

阅读原文 ↗推荐理由:填补了世界第七大语言孟加拉语在长文本神经语音合成领域的高质量专业有声读法语料空白。# 语音# 数据集# 文本正则化
arXiv 自然语言处理✦ 精选AI 评分 75/10012:00

Agentic-GER:利用全局上下文实现长语音专业术语纠错的LLM智能体

针对自动语音识别(ASR)在处理长音频时难以准确、一致转录专业术语的问题,研究人员提出了基于大语言模型的智能体 Agentic-GER。该系统利用完整转录文本的全局上下文与世界知识,识别可疑术语并化解歧义假设;同时通过选择性重新转录原始语音来核验候选修正结果,显著提升了长语音中领域专业术语的识别准确率与一致性。

阅读原文 ↗推荐理由:提出了一种结合全局上下文与选择性重转录的LLM智能体方案,有效解决了长音频ASR专业术语识别不准的难题。# 智能体# 语音# 术语纠错# 长音频
AITNT · AI头条(网页)✦ 精选AI 评分 85/10010:14

OpenAI升级ChatGPT语音功能,支持通过语音指令执行复杂工作任务

OpenAI宣布为ChatGPT Voice上线语音执行任务功能,通过接入模型与插件体系,用户可直接通过语音指令查验邮件、制作PPT、搭建网站及追回重复扣费等。该项能力已深度整合进此前推出的ChatGPT Work Agent中,新版本应用已同步面向全球用户推送,标志着语音交互进一步向具备实际操作能力的智能体演进。

阅读原文 ↗推荐理由:OpenAI将语音助手与Agent工作流深度结合,展现了语音端到端任务执行的重要应用工程进展。# OpenAI# ChatGPT# 智能体# 语音# AI办公
AITNT · AI头条(网页)✦ 精选AI 评分 75/10010:14

科大讯飞发布全国产算力训练语音识别大模型Spark-ASR-2.0

科大讯飞推出基于全国产算力训练的语音识别大模型Spark-ASR-2.0,该模型依托语音基座大模型Spark-Audio-1.0-Preview构建。新版本在方言免切换识别、嘈杂环境应对、上下文纠错以及口语书面化规范等方面实现显著提升,同时整体推理成本较上一代仅增加10%。目前,该模型已落地讯飞输入法,并通过讯飞开放平台对外提供API服务。

阅读原文 ↗推荐理由:科大讯飞基于全国产算力推出新一代语音识别大模型,在上下文理解与低成本推理上实现重要升级并已开放落地。# 科大讯飞# 语音# 算力# 大模型
TechCrunch AI✦ 精选AI 评分 75/10000:35

专访ElevenLabs首席执行官:传估值达220亿美元,企业应主动披露AI语音客服

据报道,AI语音技术独角兽ElevenLabs估值已达220亿美元。该公司首席执行官在专访中表示,ElevenLabs目前为大量客户服务通话提供语音底层支持。他指出,在机器客服成为公众普遍预期之前,使用该技术的企业或许应当主动向用户告知对方为AI,而不是隐瞒机器身份。

阅读原文 ↗推荐理由:知名语音AI独角兽ElevenLabs传出高额估值,其CEO对AI客服披露与透明度的表态值得行业关注。# ElevenLabs# 语音# 客户服务# 企业估值# AI伦理
9月24日2026-09-24
arXiv 自然语言处理✦ 精选AI 评分 62/10012:00

NADI 2026:第二届多方言阿拉伯语语音处理共享任务发布

NADI 2026 是精细阿拉伯语方言识别(NADI)系列的第七届共享任务,也是第二次专注于多方言阿拉伯语语音处理的评测。本届任务包含五项核心任务与八个子任务,覆盖自动语音识别(ASR)、方言识别(SDID)、语音合成(TTS)、语音翻译(SLT)和口语理解(SLU)。该评测重点关注低带宽、混合方言、语码转换、域外及零样本等真实场景,并首次在该系列中引入了 TTS、SLT 和 SLU 赛道。

阅读原文 ↗推荐理由:该任务系统性推进了多方言及低资源阿拉伯语语音处理的基准建设,涵盖多项复杂真实场景评估。# 语音处理# 阿拉伯语方言# 评测# 语音
arXiv 自然语言处理✦ 精选AI 评分 73/10012:00

Ruby-ASR:面向正字法与词汇读音联合识别的语音识别监督新方法

针对传统日语自动语音识别(ASR)以正字法文本作为监督目标导致相同书写形式无法区分不同实际发音、且事后文本转音素难以可靠恢复的问题,研究团队提出了 Ruby-ASR。该方法将传统的单一文本监督目标改进为跨度绑定的正字法与词汇读音联合序列,通过类旁注标记(ruby)的表示形式,完整保留了语音中的读音证据,有效提升了复杂读音场景下的识别监督精度。

阅读原文 ↗推荐理由:提出创新的监督表征结构,有效解决了日语等语言在语音识别中同字异音的监督信息缺失问题。# 语音# 日语处理# 音素识别# 模型架构
arXiv 人工智能✦ 精选AI 评分 70/10012:00

利用可控合成对话训练智能语音助手唤醒系统

该研究针对虚拟助手的人机交互场景,提出了一种新型语音唤醒系统。该方案将传统的直接关键词检测扩展为上下文触发检测,在初始唤醒词激活后,系统利用推理能力区分实际用户指令与无关语音,从而确保高效且具备上下文感知的交互。为支撑训练,研究团队设计了一套数据生成架构,成功合成了包含直接调用、上下文跟进等场景的62.3小时可控多说话人对话语料库。

阅读原文 ↗推荐理由:针对智能助手误唤醒痛点,提出了结合上下文推理的唤醒机制及配套的合成对话训练方案。# 语音# 唤醒词检测# 合成数据# 上下文感知# 人机交互
The Decoder✦ 精选AI 评分 78/10001:57

ChatGPT语音功能接入邮箱、日历与Slack,向电影《她》更进一步

ChatGPT 语音功能迎来升级,现已支持接入电子邮件、日历和 Slack 等第三方插件,并由 OpenAI 的 GPT-6 Astra、Sol 和 Luna 模型提供支持。用户仅凭语音交谈便可管理日程安排、发送邮件甚至构建网站。这一更新推动 OpenAI 进一步接近山姆·奥特曼长期设想的、类似科幻电影《她》(Her)中的全天候日常 AI 助手形态。

阅读原文 ↗推荐理由:ChatGPT 语音模式打通了核心办公生态工具,展示了语音智能体融入实际工作流的重要进展。# ChatGPT# OpenAI# 语音# 智能体# 办公协作
The Decoder✦ 精选AI 评分 78/10001:39

谷歌推出Gemini 3.8 Flash TTS模型:支持通过文本描述生成全新AI声音

谷歌发布了两款全新文本转语音模型:Gemini 3.8 Flash TTS 与 Flash-Lite TTS,支持超过100种语言。其中 Flash TTS 能够根据文本提示词直接从零设计全新声音,两款模型均允许用户为特定台词添加舞台动作指示,并支持通过单一脚本生成逼真的双人对话。此外,模型还配备了声音克隆功能,仅需30秒的音频样本即可快速建立声音特征档案。

阅读原文 ↗推荐理由:谷歌新模型实现了通过文本提示词自定义音色及脚本化双人对话控制,显著提升了语音合成的可控性与创作自由度。# Google# Gemini# 语音# 语音生成# 声音克隆
Simon Willison✦ 精选AI 评分 75/10001:12

开发者推出 Gemini 3.8 文本转语音 Playground 工具

Google 近日推出了两款全新文本转语音模型 gemini-3.8-flash-tts 与 gemini-3.8-flash-lite-tts。该系列模型内置超过 2000 种声音,并支持仅凭 30 秒音频样本生成定制声音。有开发者借助 GPT-6 Astra 搭建了自带 API Key 的测试界面,该 API 支持跨域请求,并具备便捷定义多角色对话的功能,每个角色均可独立设置不同的声音及风格指令。

阅读原文 ↗推荐理由:展示了 Google 新一代语音模型支持 30 秒声音克隆及多角色对话合成的应用潜力。# Google# Gemini# 语音# 声音克隆
TechCrunch AI✦ 精选AI 评分 82/10001:00

ChatGPT 移动端上线基于语音的智能体功能

OpenAI 为 ChatGPT 移动应用推出了基于语音交互的智能体(Agentic)功能。据介绍,Pro 和 Plus 付费订阅用户将能够在手机端通过全新的“Work”标签页,利用语音等交互方式调用智能体来完成各项自动化任务。该更新进一步拓展了移动端 AI 从单纯对话转向自主执行工作任务的能力边界。

阅读原文 ↗推荐理由:ChatGPT 移动端将语音与智能体任务执行深度整合,展示了消费级 AI 助手向自动化落地演进的重要趋势。# ChatGPT# OpenAI# 智能体# 语音# 移动应用