Google 推出 Gemini 3.8 Live:加入实时虚拟人形象 Live Avatar
Google 推出 Gemini 3.8 Live 更新,正式上线“Live Avatar”功能,为该 AI 赋予了可视化的拟人形象。用户在与模型进行实时语音对话时,该动画角色能够做到口型同步,并根据交流情境展现不同的面部表情。该功能旨在提供更具沉浸感的交互体验,目前仅面向 Gemini Enterprise 企业级客户开放。
Google 推出 Gemini 3.8 Live 更新,正式上线“Live Avatar”功能,为该 AI 赋予了可视化的拟人形象。用户在与模型进行实时语音对话时,该动画角色能够做到口型同步,并根据交流情境展现不同的面部表情。该功能旨在提供更具沉浸感的交互体验,目前仅面向 Gemini Enterprise 企业级客户开放。
谷歌正在为 Chrome 浏览器推出多项新功能,旨在简化复杂课题的研究与学习流程。其中,跨设备标签页切换功能获得了“记忆”升级,支持用户在切换到新设备时保留此前浏览的具体位置。此外,内置于 Chrome 的 Gemini 模型也迎来能力拓展,能够分析更多类型的媒体内容,并支持自动生成互动式学习测验,为用户提供更高效的网页研究体验。
根据最新消息,Gemini 3.8 Live 正式推出,并引入了实时化身(Live Avatar)交互功能。该功能预计将为多模态实时交互带来具有视觉形象的数字人体验。由于当前输入素材仅包含标题,缺乏具体的技术规格、功能演示及发布细节等详细正文内容,具体能力表现与上线范围仍需等待官方进一步披露。
Gemini 企业 Agent 平台现已开启智能体异常检测(Agent Anomaly Detection)的私有预览。该功能作为带外监管层,通过分析 OpenTelemetry 链路追踪和工具调用来捕捉行为风险,且不增加实时请求延迟。系统结合轻量统计扫描与基于 LLM 的深度推理,基于 OWASP Agentic Top 10 识别逻辑异常和违规行为。开发者可在 Security Command Center 中处理告警,或通过 API 编程阻断超出风险阈值的后续工具调用。
该内容探讨了如何借助 Gemini Enterprise Agent Platform 将 AI Agent 的安全机制从静态构建期控制转向动态运行时治理。平台提供了三大托管防御方案:用于边缘提示词审查的 Model Armor、对照业务规则评估工具调用意图的语义治理策略,以及捕获多轮对话攻击的 Agent 异常检测。通过将安全能力下沉至平台层,管理员无需修改或重新部署代码即可动态执行安全策略并抵御复杂攻击。
ADK 现已提供原生实时评估功能,旨在帮助开发者将实时语音智能体从 Demo 顺利推向生产环境。该功能允许开发者利用由 Gemini TTS 生成真实音频的 LLM 模拟用户,对基于图的智能体工作流进行多轮对话测试。通过定义评估场景和自然语言评分准则,系统可自动对语音回复和工具执行进行打分。测试结果既可在 ADK Web 中审查,也可通过 CLI 无缝集成至 CI/CD 流程中。
谷歌正推出一项早期实验性功能,允许用户将拨打本地商家的电话委托给 Gemini 处理,例如餐厅预约、查询商品库存或改期预约等。据谷歌介绍,用户甚至无需亲自拨号或发起通话,Gemini 即可全流程代为接管并完成沟通,旨在帮用户免去在电话中长时间排队等待的困扰。素材提及该功能正面向相关设备开展测试。
谷歌发布了两款全新文本转语音模型:Gemini 3.8 Flash TTS 与 Flash-Lite TTS,支持超过100种语言。其中 Flash TTS 能够根据文本提示词直接从零设计全新声音,两款模型均允许用户为特定台词添加舞台动作指示,并支持通过单一脚本生成逼真的双人对话。此外,模型还配备了声音克隆功能,仅需30秒的音频样本即可快速建立声音特征档案。
Google 近日推出了两款全新文本转语音模型 gemini-3.8-flash-tts 与 gemini-3.8-flash-lite-tts。该系列模型内置超过 2000 种声音,并支持仅凭 30 秒音频样本生成定制声音。有开发者借助 GPT-6 Astra 搭建了自带 API Key 的测试界面,该 API 支持跨域请求,并具备便捷定义多角色对话的功能,每个角色均可独立设置不同的声音及风格指令。
YouTube 正在为其创作者工作室集成一系列原生 AI 工具以辅助视频创作。新功能包括可分析脚本和粗剪内容的故事叙述助手,以及基于 Gemini 的对话式 Shorts 视频剪辑助手。此外,平台还推出了智能缩略图工具,并新增实时直播翻译功能,目前支持将英语直播即时翻译为西班牙语。这些功能的加入旨在全面提升创作者从前期策划到后期制作的分发效率。
YouTube 推出全新的自定义信息流功能,允许用户使用自然语言描述自己想要观看的视频内容。该功能借助谷歌 Gemini 大模型的技术支持,根据用户的具体提示词构建高度个性化的视频推荐流。这改变了以往用户只能被动接受平台推荐的模式,使用户能够以对话形式直接定义和掌控算法的内容分发逻辑。