DCAI
DC AI 热点

全部 AI 动态

9月25日2026-09-25
arXiv 人工智能✦ 精选AI 评分 75/10012:00

预测智能体何时应当推理?基于行为压力测试的可靠性路由研究

该研究探讨了预测智能体在结合大模型推理、信息检索、集成与校准时,各决策行为在何时具备可靠性。研究人员在ForecastBench风格的二元预测任务上,将智能体选择检索、推理、参考市场先验或采用历史类比等策略视为可观测行为并展开压力测试。核心结论显示,机制的最优选择高度依赖于数据生成源,结构化类比在特定数据流程中占据主导,而市场群体策略与保守基线在其他情境下表现更优。

阅读原文 ↗推荐理由:系统化探索了预测智能体在多策略切换下的行为可靠性,为智能体决策路由工程提供了实用参考。# 预测智能体# 智能体工程# 模型推理# 压力测试# 可靠性
9月24日2026-09-24
arXiv 人工智能✦ 精选AI 评分 72/10012:00

论文提出Policy-as-Skill:面向大模型决策支持的可治理与审计模块化运行时

针对企业利用大语言模型进行合规、风险及运营决策时对证据验证、审查路由与可审计性的高要求,研究人员提出了Policy-as-Skill(PaS)模块化运行时框架。该框架将上述功能打包为可执行且具备版本控制的策略能力。在基于固定模型后端的600项开发任务评估中,PaS+Audit方案取得了53.8%的准确率、100%的引用精确度与审计完整性,在绝大多数治理与合规指标上超越了传统LLM+RAG架构。

阅读原文 ↗推荐理由:将企业合规与治理规则工程化为可执行的AI技能运行时,显著改善了大模型决策的审计追溯与确定性控制能力。# 大语言模型# 决策支持# AI治理# 合规审计# 智能体工程