反思复杂拓扑:相异对等随机路由提升多智能体辩论成本效益
该研究探讨了大型语言模型多智能体辩论(MAD)中的通信拓扑问题。针对当前学术界倾向于设计复杂、自适应或动态重构交互拓扑以提升推理准确率的趋势,研究团队深入审视了稀疏通信机制。论文提出“相异对等随机路由”方法,旨在探究是否真的需要复杂的拓扑控制,证实简单的稀疏通信即可在显著降低成本的同时实现极具竞争力的推理性能,为优化多智能体交互架构提供了更具成本效益的新思路。
该研究探讨了大型语言模型多智能体辩论(MAD)中的通信拓扑问题。针对当前学术界倾向于设计复杂、自适应或动态重构交互拓扑以提升推理准确率的趋势,研究团队深入审视了稀疏通信机制。论文提出“相异对等随机路由”方法,旨在探究是否真的需要复杂的拓扑控制,证实简单的稀疏通信即可在显著降低成本的同时实现极具竞争力的推理性能,为优化多智能体交互架构提供了更具成本效益的新思路。
研究人员将最小风险训练(MRT)应用于全国停电数据倡议(ODIN)的停电报告生成任务。不同于传统仅依赖词元级最大似然目标的方法,MRT使模型能够直接针对序列级评估指标进行优化。该方法将异构停电报告转化为符合CIM IEC 61968-3标准的规范XML格式,显著提升了Qwen2.5-7B等小型语言模型在垂直结构化报告生成任务中的准确性与可用性。
随着计算机使用智能体(CUA)日益广泛地代表用户执行在线操作,当所处环境的利益激励与用户目标不一致(如电商平台倾向于推荐特定商品而诱导智能体偏离目标)时,智能体表现面临新挑战。现有基准多局限于合作场景或显式攻击,忽略了环境自身存在利益诉求的情况。为此,研究团队推出了受控基准测试 CAVEAT,涵盖 9 个市场环境及相关分类法,专门评估智能体在利益错位环境下的目标坚守能力。
针对长流程大语言模型智能体积累海量交互历史带来的效率挑战,现有压缩策略通常独立评估单条记录,忽略了组合删除所引起的冗余或累积信息损失。为此,研究团队提出了直接关系集合风险修剪(DRSR)框架。该方法将智能体历史上下文压缩建模为基于删除集合的风险约束选择问题,从集合层面综合评估删除风险与保留信息,在保障决策安全与任务表现的前提下,实现了长程智能体的高效修剪。
该研究针对通过调用外部工具回答分析问题的时间序列智能体,指出了传统人工预设工具配置的缺陷:一是人机工具不匹配,专家挑选的工具库可能在特定任务中降低异常检测准确率;二是隐性损害,常规自我修正可能在微弱提升总体评分的同时破坏原有的正确答案。论文指出工具的有效性需在运行时根据具体问题动态决定,并提出了故障驱动的智能体自我演化方案。
长期与用户交互的智能体需要准确召回事实、偏好和事件等信息,但现有记忆系统常将其压缩为通用摘要或检索无标签文本块,难以精准识别实体属性及支撑依据。研究人员提出了EnSIMem,一种面向智能体的实体结构化长期记忆架构。该系统在离线阶段将历史交互组织为主题连贯的情节片段,并构建基于对话的实体索引条目,以提升长上下文对话中智能体记忆检索与推理的准确性。
在执行长程任务时,智能体会持续积累交互历史,而既有上下文管理方法多依赖固定窗口或即时相关性,难以判断历史交互何时可安全替换。过早压缩易导致未来关键信息丢失,过度保留又会带来巨大的上下文开销。为此,该研究提出了状态条件压缩框架StateComp,旨在根据智能体的状态演变动态学习何时适合压缩历史,在降低上下文负载的同时保留关键信息(注:原文摘要末尾内容有所截断)。
针对图形用户界面(GUI)智能体在执行复杂软件指令时所需的分步推理与长程记忆能力,研究团队探索了在线自蒸馏(OPSD)技术的应用。现有OPSD方法虽在GUI定位等基础任务上表现优异,但在向多轮交互场景扩展时受限于自教师模型的特权机制(原摘要末尾存在信息截断)。该研究旨在通过从自身交互中学习,改进自蒸馏机制以提升多轮GUI智能体的决策执行效果。
arXiv:2609.27332v1 Announce Type: new Abstract: Long horizon agents accumulate growing interaction histories that increase context and inference costs. We find that geometric redundancy alone is an insufficient criterion for safe compression. Although agent histories exhibit strong low dimensional structure, similar global geometry can preserve very different amounts of task evidence. At identical retained block counts, evidence aware selection raises next action Top 3 retention from 0.31 to 0.69, while centroid similarity remains 0.98. Controlled replacement further shows that action related information can be substantially altered while glo
arXiv:2609.27349v1 Announce Type: new Abstract: Real-world molecular design remains challenging for large language model (LLM)-based agents. It requires them to interpret design contexts, satisfy multiple constraints, identify infeasible specifications, and reason over multi-step tool outputs. Existing benchmarks do not capture this complexity, focusing instead on explicit and narrow constraints, only feasible problems, and single-path solutions. To address this gap, we propose MolDesignBench, a scenario-grounded benchmark that more closely reflects real-world molecular design for evaluating tool-augmented LLM agents. MolDesignBench comprises
arXiv:2609.27417v1 Announce Type: new Abstract: Symbiosis between humans and digital beings offers a vision for the future of human--machine interaction. In enduring human--machine relationships, personality provides a foundation for continuity of identity, individuality in interaction, and development through experience. We investigate this capacity through persona agents as computational implementations and introduce Emergi-PersonaOS, a psychology-grounded operating system for managing persona objects throughout their lifecycle. The system organizes dispositional traits, characteristic adaptations, and narrative identity into a three-layer
根据素材信息,Meta依靠自研的Manus产品引发市场热烈反响,推动其股价单日暴涨11%。该应用目前已成功登顶苹果应用商店,在用户增速上反超ChatGPT,并在美国市场引发了极高关注度与使用热潮。由于当前输入素材信息较为简短,关于该自研产品的具体技术架构、功能细节及其持续市场表现等完整事实仍需更多后续资讯补充验证。
WorkBuddy 尝试将办公智能体(Agent)打造为类似“赛博乐高”的可自由搭建形态,旨在解决真实办公场景中的实用痛点。文章以 PPT 制作后常面临反复修改为例,指出实际工作流对 AI 智能体有着更高的灵活度要求。由于目前素材提供的信息较为有限,关于 WorkBuddy 的具体功能实现、技术架构及实际应用细节尚待进一步补充与披露。
在 Meta 年度的 Connect 大会上,公司首席执行官马克·扎克伯格在开幕演讲中明确表示,Meta 正在全面押注其 AI 智能体 Muse。本次大会展示了 Muse 带来的多项全新功能与升级特性。此外,Meta 还宣布 Muse 将被引入其 AI 智能眼镜设备中,进一步加速该智能体在穿戴硬件端的融合与落地应用。
mlxrunner 发布了 v0.34.4-rc1 预发布版本。该版本将 XGrammar 依赖项升级至 0.2.7 版本,以改善模型的结构化输出能力。本次更新重点包含针对模式(Schema)的修复,解决了带类型字典值以及短数组在处理过程中的相关问题。原素材为轻量级版本发布说明,提供的具体技术细节相对有限。
YouTube 宣布将在今年晚些时候带来重要功能更新,重点发力人工智能与直播领域。平台承诺将推出自定义信息流,并大幅增加 AI 技术的应用,预计将在未来一年内改变用户消费和发现内容的方式。此举旨在通过技术升级提升用户的个性化体验。目前官方披露的细节相对有限,具体功能形态及落地时间仍有待后续进一步公布。
该版本针对 Claude 应用网关进行了多项功能更新:支持 Claude Desktop 新增的策略配置,包括限制工作目录外读取权限及禁用权限绕过模式;在 Amazon Bedrock 上游中新增通过 STS 实现跨账户 AssumeRole 的 IAM 角色调用支持;提供对 Bedrock 护栏(Guardrail)的统一配置支持;并在网关配置中引入了遥测资源属性设置。
荷兰百年零售巨头 HEMA 借助 Amazon Bedrock AgentCore 构建了名为 HAL 的内部 AI 助手,以解决员工频繁切换系统门户查找信息的痛点。HAL 采用模型上下文协议(MCP),直接在团队现有的日常工具内提供受治理的企业知识与即时解答。该方案强化了安全架构,客户端无需配置 AWS 凭证,而是统一由 Microsoft Entra ID 保障身份与访问安全。
该方案展示了如何在 AWS 上利用智能体架构构建对话式视频智能分析系统。系统通过 Strands Agents SDK 构建单一智能体,在运行时动态编排 Amazon Bedrock、Amazon Rekognition 和 Amazon Transcribe 等多项服务,自主决策调用对应模块,使用户能够通过自然语言对视频内容提问,并在数秒内获得精准解答。
本文介绍了如何将开源终端原生 AI 编码智能体 OpenCode 与 Amazon Bedrock 上的开放权重模型结合,打造安全、灵活且按需付费的代码助手。开发者可以配置多模型工作流,为不同任务匹配适合的模型,并在无需管理底层基础设施的情况下,将所有数据保留在自己的 AWS 账户内,兼顾开发效率与数据安全性。
ChatGPT 语音功能迎来升级,现已支持接入电子邮件、日历和 Slack 等第三方插件,并由 OpenAI 的 GPT-6 Astra、Sol 和 Luna 模型提供支持。用户仅凭语音交谈便可管理日程安排、发送邮件甚至构建网站。这一更新推动 OpenAI 进一步接近山姆·奥特曼长期设想的、类似科幻电影《她》(Her)中的全天候日常 AI 助手形态。
Google 近日推出了两款全新文本转语音模型 gemini-3.8-flash-tts 与 gemini-3.8-flash-lite-tts。该系列模型内置超过 2000 种声音,并支持仅凭 30 秒音频样本生成定制声音。有开发者借助 GPT-6 Astra 搭建了自带 API Key 的测试界面,该 API 支持跨域请求,并具备便捷定义多角色对话的功能,每个角色均可独立设置不同的声音及风格指令。
OpenAI 为 ChatGPT 移动应用推出了基于语音交互的智能体(Agentic)功能。据介绍,Pro 和 Plus 付费订阅用户将能够在手机端通过全新的“Work”标签页,利用语音等交互方式调用智能体来完成各项自动化任务。该更新进一步拓展了移动端 AI 从单纯对话转向自主执行工作任务的能力边界。
据相关消息披露,随着人工智能技术的演进,移动端跨平台开发的成本效益取舍正在发生变化,电商平台Shopify已决定弃用原先采用的React Native框架,转而重回Swift与Kotlin进行原生开发。目前输入素材仅包含简要标题,尚未提供具体的技术迁移细节、实施时间表以及AI如何在其中降低原生开发门槛的深入分析,更多具体信息仍有待后续详细披露。
YouTube 正在为其创作者工作室集成一系列原生 AI 工具以辅助视频创作。新功能包括可分析脚本和粗剪内容的故事叙述助手,以及基于 Gemini 的对话式 Shorts 视频剪辑助手。此外,平台还推出了智能缩略图工具,并新增实时直播翻译功能,目前支持将英语直播即时翻译为西班牙语。这些功能的加入旨在全面提升创作者从前期策划到后期制作的分发效率。