DCAI
DC AI 热点

全部 AI 动态

9月25日2026-09-25
arXiv 人工智能✦ 精选AI 评分 75/10012:00

skilder:基于角色权限控制的LLM智能体渐进式技能发现治理框架

针对大语言模型智能体在接入海量企业工具时面临的上下文超限、工具选择退化及合规治理漏洞等问题,研究人员提出了名为 skilder 的新框架。传统通过提示词设定的安全策略缺乏硬性约束,而多智能体委托方案又分散了审计日志。skilder 将技能与工具等能力打包为特定角色,通过基于角色的范围划分与渐进式技能发现机制,实现对智能体工具调用的结构化治理与确定性访问控制。

阅读原文 ↗推荐理由:针对企业级大模型智能体调用海量工具时的治理与性能痛点,提出了结构化的访问控制框架。# LLM智能体# 工具调用# 访问控制# 企业治理# 应用工程
arXiv 人工智能✦ 精选AI 评分 72/10012:00

动作归因何时需要更新?面向工具调用型智能体的高效更新机制研究

针对工具调用型智能体在策略持续更新中动作归因(Action Credit)失效、重新计算导致昂贵工具调用与环境交互成本的问题,该研究探讨了历史归因何时真正需要更新。研究核心发现,动作价值的变化并不一定会导致最终决策的改变;只要策略诱导的漂移不足以颠覆原有决策,历史动作归因即可继续复用,从而大幅降低计算开销。(注:原始摘要文本存在部分截断)

阅读原文 ↗推荐理由:聚焦工具调用智能体策略更新中的交互成本痛点,提出了通过判断决策漂移来复用历史归因的优化思路。# 智能体# 工具调用# 动作归因# 策略优化# 强化学习
9月24日2026-09-24
arXiv 人工智能✦ 精选AI 评分 76/10012:00

智能体与工具交互中的“静默失败”现象:针对 ToolUniverse 的审计研究

随着智能体 AI 系统逐步采用整合多工具的自动化流程,智能体与工具间交互的可靠性日益受到关注。该研究针对生物学智能体等工作流场景,系统调查了交互过程中的“静默失败”问题。此类故障表现为工具调用表面上显示成功,但 API 或封装层返回的信息与功能实际存在缺失或残缺,且未向用户或智能体发送任何异常通知。该研究填补了此前评测仅关注任务完成率而忽视交互底层隐性故障的空白。

阅读原文 ↗推荐理由:揭示了智能体调用外部工具时“看似成功实则信息缺失”的静默失败隐患,对提升复合智能体系统的工程可靠性具参考价值。# 智能体# 工具调用# 静默失败# ToolUniverse# 系统可靠性
arXiv 人工智能✦ 精选AI 评分 75/10012:00

TwinCheck:面向有状态工具智能体的反事实负孪生验证机制

针对单一局部合理的工具调用可能导致整个智能体执行轨迹失败的问题,研究人员提出了一种名为 TwinCheck 的推理期验证策略。该策略认为仅凭怀疑进行干预可能引入新错误,因此仅在轨迹满足与局部失败假设相关的证据条件时才触发替换。系统通过构建基于轨迹的反事实替代方案(即“负孪生”),仅当该方案通过结构检查且成对验证器判定其更优时,才替换智能体原有的提议调用,有效提升了执行可靠性。

阅读原文 ↗推荐理由:提出了一种创新的推理期反事实验证机制,有效解决了工具智能体在调用干预时容易误伤有效轨迹的难题。# AI智能体# 工具调用# TwinCheck# 推理期验证# 轨迹验证
arXiv 人工智能✦ 精选AI 评分 75/10012:00

TimeEvo:基于故障驱动的时序数据智能体自我演化机制

该研究针对通过调用外部工具回答分析问题的时间序列智能体,指出了传统人工预设工具配置的缺陷:一是人机工具不匹配,专家挑选的工具库可能在特定任务中降低异常检测准确率;二是隐性损害,常规自我修正可能在微弱提升总体评分的同时破坏原有的正确答案。论文指出工具的有效性需在运行时根据具体问题动态决定,并提出了故障驱动的智能体自我演化方案。

阅读原文 ↗推荐理由:深入剖析了时序分析智能体在工具调用与自我修正中的失效机理,提出了自演化解决思路。# AI智能体# 时间序列# 工具调用# 自我演化# TimeEvo