DCAI
DC AI 热点

精选

当前热点完整榜单 →
1马斯克披露AI算力布局:Colossus集群拟部署超百万张英伟达GB300芯片84 热度 ⌁2试图入侵政府与高校网站:OpenAI 智能体4次“失控”行为细节曝光81 热度 ⌁3美国能源部拨款19亿美元支持31个电网升级项目以加速数据中心并网81 热度 ⌁4谷歌支持的Fervo Energy在犹他州Cape Station地热电站实现首次发电79 热度 ⌁5针对长上下文编程优化,Claude Opus 5.5 正式发布76 热度 ⌁
9月24日2026-09-24
arXiv 机器学习✦ 精选AI 评分 72/10012:00

序列推荐系统时序归因可解释方法系统基准测试

序列推荐系统通过用户历史交互序列驱动下一步决策,是现代个性化服务的核心。基于CNN和Transformer的深度学习架构虽能有效捕获时序依赖,但其非线性特征导致模型沦为黑盒。为了提升模型透明度与信任度,帮助开发者审查模型行为并为用户提供推荐依据,该研究针对序列推荐系统中的时序归因可解释性方法展开系统化基准评估(注:原论文摘要结尾存在截断,具体评估结果详见完整论文)。

阅读原文 ↗推荐理由:针对黑盒序列推荐模型建立了时序归因可解释性基准,对提升推荐算法的可解释性与透明度具有参考价值。# 序列推荐# 可解释AI# 时序归因# Transformer# 评测
arXiv 人工智能✦ 精选AI 评分 75/10012:00

LLM用户模拟器特征干扰诊断:行为特征如何渗透并扭曲偏好

基于大语言模型(LLM)的用户模拟器常用于推荐系统评估,通过设定偏好属性(交互内容)与行为活跃度特征(浏览时长)来模拟真实用户。研究发现,模拟过程中这两种特征设定的独立性会失效:一是产生特征干扰,过高的活跃度会打破偏好边界,迫使模型与不匹配内容交互以维持浏览;二是导致评估失效,满意度评分会随着活跃度驱动的页面数量虚假膨胀。

阅读原文 ↗推荐理由:揭示了LLM智能体在用户仿真中行为与偏好解耦失效的机制,对推荐系统评测及多特征智能体构建具有重要参考价值。# 大模型# 用户模拟器# 智能体仿真# 推荐系统# 特征干扰
arXiv 机器学习✦ 精选AI 评分 68/10012:00

基于电阻曲率的可扩展图神经网络子图采样方法

针对大规模图神经网络(GNN)训练中传统采样标准易忽略边几何角色的问题,本研究提出了一种由电阻曲率引导的高效子图采样框架。该方法依托面向大图的曲率近似算法 ERC-LG,结合 Johnson-Lindenstrauss 投影与多 GPU 批处理共轭梯度求解器,避免了昂贵的显式拉普拉斯伪逆计算和全局嵌入存储,能有效利用几何曲率指导节点与边的采样概率。注:原始摘要文本在实验部分存在截断。

阅读原文 ↗推荐理由:将图几何曲率与 GPU 快速求解相结合,为大规模图神经网络训练开辟了兼顾结构特征与效率的采样新路径。# 图神经网络# 子图采样# 电阻曲率# 模型训练# 算法优化
arXiv 人工智能✦ 精选AI 评分 72/10012:00

面向自动定理证明树搜索的大模型生成器直接优化研究

该论文针对自动定理证明(ATP)中微调大语言模型的对齐问题展开研究。当前大模型常作为树搜索的引导策略,而传统交叉熵损失在搜索场景下并非最优。将对齐策略拓展至树搜索具有较大挑战,因为证明发现过程高度依赖监督演示中未包含的偏离轨迹状态的探索与恢复。为此,作者拓展了相关计算对齐方法以直接优化搜索生成器。注:由于原摘要结尾截断,更多技术细节尚未完整披露。

阅读原文 ↗推荐理由:探索了针对树搜索场景直接优化大模型的新损失函数与对齐机制,对提升大模型在形式化数学与逻辑推理任务中的表现具有参考价值。# 自动定理证明# 大模型# 树搜索# 微调# 强化学习对齐
arXiv 机器学习✦ 精选AI 评分 68/10012:00

面向保形椭球的尾部感知几何学习研究

该研究聚焦于多元保形预测(CP)这一具备有限样本覆盖保证的无分布不确定性量化框架。针对现有最小体积方法依赖分位数阈值、忽略尾部残差严重性并将几何学习与覆盖水平隐式绑定的问题,研究团队提出了一种用于保形椭球的尾部感知几何学习框架。该方法成功将几何学习中的尾部敏感性与最终覆盖保证解耦,从而提升了多元预测集的构建效率与几何表征能力。

阅读原文 ↗推荐理由:针对多元保形预测中的残差几何与覆盖保证解耦提出了创新算法框架,对不确定性量化理论具有一定学术价值。# 保形预测# 不确定性量化# 机器学习# 几何学习# 残差分析
arXiv 人工智能✦ 精选AI 评分 65/10012:00

结肠镜检查中假阳性AI辅助提示对医生注视行为影响的眼动追踪研究

该研究探讨了计算机辅助检测(CADe)系统在结肠镜检查中产生的假阳性提示对内窥镜医生注意力的分散效应。研究结合回顾性配对视频实验与前瞻性实时眼动追踪,分析了3名资深及2名初级医生观看60段视频的表现,并记录了9名资深医生在42例实时辅助检查中的视线变化,量化了假阳性提示对注视吸引和注意力占用的具体影响。由于摘要截断,更细致的结果未完整展示。

阅读原文 ↗推荐理由:该研究利用眼动追踪技术实证评估了医疗AI假阳性提示对临床医生注意力的人机交互影响,对优化辅助诊断工具具有参考价值。# 医疗AI# 计算机辅助检测# 眼动追踪# 人机交互# 结肠镜检查
arXiv 机器学习✦ 精选AI 评分 68/10012:00

fMRI基础模型扩展法则实证研究

针对功能性磁共振成像(fMRI)基础模型中数据规模、模型大小与算力关系尚不明确的问题,研究团队进行了一项系统性的对照实证扩展研究。该研究汇聚了超过200个源数据集的预训练数据,消耗逾10,000个GPU时。在固定预训练框架与下游评测协议的条件下,系统探究了数据量、参数量和训练时长的协同变化规律,结果显示下游任务性能总体上随着计算量的增加而提升。

阅读原文 ↗推荐理由:该研究系统性探索了fMRI神经影像基础模型的扩展法则,为脑科学与医学影像大模型设计提供了重要实证参考。# fMRI# 大模型# 扩展法则# 神经影像# AI医疗
arXiv 人工智能✦ 精选AI 评分 68/10012:00

研究揭示Transformer注意力头数对序列有序性判断的表达能力界限

该研究探讨了Transformer架构在序列排序判断任务中的表达能力。论文证明,判断一个比特序列是否处于有序状态的任务无法由单头单层(1-head 1-layer)Transformer完成,但可以通过双头单层(2-head 1-layer)Transformer实现。与以往同类理论成果不同的是,该研究的结论建立在模型包含输出多层感知机(MLP)的架构设定之下。

阅读原文 ↗推荐理由:该论文从理论上严格证明了注意力头数量对基础逻辑任务的影响,推进了带MLP的Transformer模型表达能力边界研究。# Transformer# 表达能力# 注意力机制# 理论研究# 模型架构
arXiv 机器学习✦ 精选AI 评分 72/10012:00

CELLAUDIT:用于审查智能体发现细胞模型中输入有效性的审计框架

针对 AI 虚拟细胞模型在预测生物干预响应时可能并未真正利用输入信息的“预测-主张差距”,研究团队提出了审计框架 CELLAUDIT。在大模型智能体自动发现和迭代预测模型的场景下,CELLAUDIT 从源码计算路径、拟合依赖性以及实际预测贡献三个维度切入,系统性验证模型对输入扰动信息的使用主张是否属实,以确保智能体生成的科学预测模型具备真正的因果有效性和可靠性。

阅读原文 ↗推荐理由:针对智能体自动发现科学模型中的可信度与虚假相关问题,提出了全流程输入审查的新方法。# AI for Science# 智能体# 虚拟细胞# 模型审计# 可解释性
arXiv 人工智能✦ 精选AI 评分 75/10012:00

评估代码智能体内核漏洞利用能力:安全评测基准 KEX-bench 发布

尽管代码智能体现已能在生产软件中发现实际漏洞,但漏洞挖掘成果并不等同于构建漏洞利用原语的能力。为此,研究团队推出了用于评估代码智能体针对真实操作系统内核生成利用原语的基准 KEX-bench。该基准涵盖 40 个 Linux 与 Windows 真实 CVE 的 45 个任务实例,涉及内核地址泄露、指令指针控制和任意地址读写等场景,并在隔离虚拟机环境中借助确定性验证器评估智能体的利用能力。

阅读原文 ↗推荐理由:首个专门评估代码智能体在真实操作系统内核中构建漏洞利用原语的安全基准,对前沿 AI 攻防能力边界评估具有重要参考价值。# 安全# 代码智能体# 漏洞利用# 评测
arXiv 机器学习✦ 精选AI 评分 72/10012:00

面向在线自适应的贝叶斯神经网络全协方差平滑算法

该研究提出了一种面向在线自适应的贝叶斯神经网络训练方法。研究将神经网络各层视为状态空间模型的时间步,把贝叶斯训练转化为平滑问题:前向过程传播高斯矩,反向 RTS 平滑过程则以闭式解更新权重后验。这种方法单次遍历即可完成学习,具备不确定性感知能力,且无需梯度迭代或经验回放,非常适用于高数据效率的在线自适应场景。针对以往方法受限于激活对角协方差的瓶颈,该工作展开了全协方差平滑研究。

阅读原文 ↗推荐理由:提出无需梯度迭代的贝叶斯神经网络在线自适应方法,为小样本增量学习与不确定性量化提供了新思路。# 贝叶斯神经网络# 在线自适应# 状态空间模型# 模型架构# 无梯度学习
arXiv 机器学习✦ 精选AI 评分 75/10012:00

LLMAE:将预训练大语言模型改造为高保真连续文本自编码器

针对自回归语言模型仅能通过序列分解间接表示全局结构、缺乏类似图像领域的忠实连续表征这一问题,研究人员提出了LLMAE方法。该方法将预训练的仅解码器(decoder-only)大语言模型重新利用为连续文本自编码器,通过在其内部激活状态中构建一个中间固定长度的潜在瓶颈(latent bottleneck),成功为文本生成提供了可操作的高保真连续潜空间表征。

阅读原文 ↗推荐理由:探索了利用预训练LLM构建文本连续潜空间的新架构方法,对文本生成与表征学习具有重要参考价值。# 大模型# 自编码器# 连续潜空间# 模型架构# 表征学习
arXiv 机器学习✦ 精选AI 评分 75/10012:00

柏拉图表征假设中究竟在收敛什么?结构优先于几何

柏拉图表征假设提出高能力模型会趋向于收敛至共享表征,而近期研究将其范围缩减为共享局部邻域关系,并认为校准后全局相似性趋势大多消失。该研究对这一解读提出质疑,指出以往的局部与全局对比混淆了结构尺度(局部与全局)与对比对象本身的差异,即由样本关联定义的“关系结构”和由距离等量化关系表征的“度量几何”被混为一谈,重新澄清了模型表征收敛的实质。

阅读原文 ↗推荐理由:深入探讨了模型表征收敛的理论机制,纠正了学界对局部与全局几何相似性分析的混淆。# 表征学习# 柏拉图假设# 深度学习理论# 模型架构# 几何结构
arXiv 人工智能✦ 精选AI 评分 76/10012:00

智能体与工具交互中的“静默失败”现象:针对 ToolUniverse 的审计研究

随着智能体 AI 系统逐步采用整合多工具的自动化流程,智能体与工具间交互的可靠性日益受到关注。该研究针对生物学智能体等工作流场景,系统调查了交互过程中的“静默失败”问题。此类故障表现为工具调用表面上显示成功,但 API 或封装层返回的信息与功能实际存在缺失或残缺,且未向用户或智能体发送任何异常通知。该研究填补了此前评测仅关注任务完成率而忽视交互底层隐性故障的空白。

阅读原文 ↗推荐理由:揭示了智能体调用外部工具时“看似成功实则信息缺失”的静默失败隐患,对提升复合智能体系统的工程可靠性具参考价值。# 智能体# 工具调用# 静默失败# ToolUniverse# 系统可靠性
arXiv 人工智能✦ 精选AI 评分 72/10012:00

极简大模型智能体框架JAZ:以最小化控制架构探索最大表达能力

现代大语言模型智能体大多依托于由模型与工具调用构成的核心循环(Agent Loop)运行,但处理记忆增强与自我改进等复杂工作流时,通常依赖复杂的额外工程系统。为此,研究团队构建了极简智能体框架JAZ,旨在探索仅依靠最基础的循环机制,在多大程度上能够替代并完成此类专门系统的任务。由于原文摘要结尾存在截断,关于JAZ具体暴露的接口与机制细节仍有待全文披露。

阅读原文 ↗推荐理由:该研究尝试通过极简设计降低智能体系统的工程复杂度,对Agent系统架构与工程落地具有参考价值。# 智能体# 大模型# Agent Loop# 系统框架# 软件工程
arXiv 人工智能✦ 精选AI 评分 75/10012:00

TwinCheck:面向有状态工具智能体的反事实负孪生验证机制

针对单一局部合理的工具调用可能导致整个智能体执行轨迹失败的问题,研究人员提出了一种名为 TwinCheck 的推理期验证策略。该策略认为仅凭怀疑进行干预可能引入新错误,因此仅在轨迹满足与局部失败假设相关的证据条件时才触发替换。系统通过构建基于轨迹的反事实替代方案(即“负孪生”),仅当该方案通过结构检查且成对验证器判定其更优时,才替换智能体原有的提议调用,有效提升了执行可靠性。

阅读原文 ↗推荐理由:提出了一种创新的推理期反事实验证机制,有效解决了工具智能体在调用干预时容易误伤有效轨迹的难题。# 智能体# 工具调用# TwinCheck# 推理期验证# 轨迹验证
arXiv 人工智能✦ 精选AI 评分 68/10012:00

面向交互式多智能体模拟构建社会情感人工智能架构

该研究旨在为动态模拟世界中人类与多智能体的交互提供设计原则和软件架构。结合通用人工智能(AGI)发展、Transformer对话智能体的普及以及计算能力的提升,文章梳理了过往与当前的多智能体心智理论,重点关注具备社会与情感认知能力的智能体,探讨智能体之间及其与人类互动的综合设计方法,以增强多智能体系统的交互理解与协同模拟能力。

阅读原文 ↗推荐理由:探讨了融入社会与情感认知机制的多智能体系统架构设计,为人机协同与复杂模拟提供了新思路。# 智能体# 心智理论# 社交AI# 人机交互
arXiv 人工智能✦ 精选AI 评分 68/10012:00

可控多元对齐研究:预测目标冲突并高效覆盖多目标权衡

该论文针对大型语言模型多元对齐中价值观冲突的问题,研究了可控模型如何在竞争性目标间平衡权衡。多目标直接偏好优化(MODPO)通过目标权重覆盖连续权衡区间,本研究探讨了模型何时可同时提升两个目标,以及如何避免为每种权衡单独训练模型。基于HelpSteer和UltraFeedback的七组目标测试,研究提出了可预测目标冲突的预训练测量方法,以实现更高效的多元对齐。

阅读原文 ↗推荐理由:针对多目标对齐与个性化偏好优化的前沿理论研究,有助于提升大语言模型动态权衡多种冲突需求的能力。# 多目标对齐# 偏好优化# MODPO# 大模型# 对齐
arXiv 人工智能✦ 精选AI 评分 72/10012:00

PLLM+:基于混合重放与大模型修复的Python依赖解析管线

该论文针对Python生态中因版本不兼容与包缺失导致的“依赖地狱”问题,提出了混合依赖修复管线PLLM+。该方法在包含2891个报错片段的HG2.9K基准上进行了验证。PLLM+在调用大语言模型前,优先执行低成本确定性策略,包括基于AST的静态解释器推断、历史成功配置重放以及实时PyPI验证,随后结合LLM进行精准修复,有效提升了真实代码的执行成功率。

阅读原文 ↗推荐理由:提出结合确定性推断与大模型修复的混合流水线,有效化解了AI代码执行与软件工程中的依赖配置痛点。# 大模型# AI编程# 软件工程# 依赖管理
arXiv 人工智能✦ 精选AI 评分 75/10012:00

相同证据不同判定:多模态大模型在图文及语音文本冲突中存在证据不可交换性

该论文探讨了多模态大语言模型在图像或语音与伴随文本发生冲突时的偏好机制。针对以往文本偏置研究中证据顺序固定或指令位置变化导致成因不明的问题,研究团队采用配对比较法,在固定指令与证据内容的前提下仅互换两类模态信息的输入顺序。实验覆盖视觉与语音模型,发现将图像或音频置于冲突文本之后会持续改变模型判定,证实了模型处理冲突证据时存在显著的顺序敏感性与不可交换性。

阅读原文 ↗推荐理由:深入探讨了多模态大语言模型在多模态冲突场景下的位置偏差与模态依赖机制,对模型鲁棒性评测具参考价值。# 大模型# 模态冲突# 位置偏置# 前沿研究# 可解释性
arXiv 人工智能✦ 精选AI 评分 75/10012:00

基于子任务分解的强化学习方法:改进大语言模型策略优化

针对群组相对策略优化(GRPO)等主流策略梯度方法在训练语言模型智能体时将多轮交互压缩为单一标量轨迹奖励的痛点,研究指出该做法在稀疏和延迟反馈的多技能复合任务中存在严重的信息损失,优化器难以推断具体能力对结果的贡献。为此,论文提出应将轨迹奖励沿子任务进行解耦与分解后再进行策略更新,从而实现更精准的信用分配与行为调整。

阅读原文 ↗推荐理由:针对大模型强化学习主流算法GRPO在多轮复杂任务中奖励归因模糊的核心痛点,提出了子任务奖励分解的优化思路。# 强化学习# 语言模型智能体# 策略优化# 奖励建模
arXiv 人工智能✦ 精选AI 评分 70/10012:00

利用可控合成对话训练智能语音助手唤醒系统

该研究针对虚拟助手的人机交互场景,提出了一种新型语音唤醒系统。该方案将传统的直接关键词检测扩展为上下文触发检测,在初始唤醒词激活后,系统利用推理能力区分实际用户指令与无关语音,从而确保高效且具备上下文感知的交互。为支撑训练,研究团队设计了一套数据生成架构,成功合成了包含直接调用、上下文跟进等场景的62.3小时可控多说话人对话语料库。

阅读原文 ↗推荐理由:针对智能助手误唤醒痛点,提出了结合上下文推理的唤醒机制及配套的合成对话训练方案。# 语音# 唤醒词检测# 合成数据# 上下文感知# 人机交互
arXiv 人工智能✦ 精选AI 评分 75/10012:00

大模型陈述的推理步骤是否真正承载因果权重?

思维链(CoT)监控通常假设模型生成的推理过程真实反映了得出答案的计算机制。以往评估推理真实性的指标主要停留在行为层面,即通过修改推理文本来观察输出变化。该研究提出一种在激活层面测量自生成推理真实性的因果分析方法。与以往仅评估性能衰减的因果审计不同,该方法通过带有已知反事实目标的激活干预,验证每一次干预是否能将答案切换至特定的反事实实体,从而精确评估推理步骤的因果支撑度。

阅读原文 ↗推荐理由:该研究深入模型激活层面验证思维链推理的因果真实性,为大模型的可解释性与推理可靠性评估提供了关键方法。# 思维链# 可解释性# 因果分析# 前沿研究# 大模型
arXiv 人工智能✦ 精选AI 评分 74/10012:00

大语言模型数学推理机制按方法而非学科主题组织

一项针对大语言模型内部计算机制的研究显示,开源数学模型在处理问题时更倾向于按可复用的“推理方法”而非传统的“学科主题”组织内部计算。研究团队提出了一种“生成-重放协议”,先由模型生成解题步骤,再重放完整的提示词与生成轨迹,借此提取推理 token 的激活重要性特征并进行无监督聚类。该研究为理解 LLM 如何在内部表征和执行数学推理提供了新的可解释性视角。

阅读原文 ↗推荐理由:揭示了大模型内部按通用求解方法而非学科主题组织数学推理的计算机理,具有理论研究价值。# 大模型# 数学推理# 可解释性# 前沿研究# 注意力机制
arXiv 人工智能✦ 精选AI 评分 68/10012:00

提议而不自判:面向量化因子挖掘LLM智能体的随时有效裁判机制

该研究探讨了大语言模型智能体在量化因子全流程研究中的职责划分。研究团队提出了一种“受管制的自我演化”框架:智能体仅负责提出投资因子假设,而由一个独立的固定统计裁判机制进行评估。裁判仅根据因子提交后披露的真实市场表现进行动态评分与对赌,从而确保在任意停止时间下均具备防伪发现的统计保证。该设计有效解决了智能体既当运动员又当裁判所带来的过拟合与数据窥探问题。

阅读原文 ↗推荐理由:针对LLM在量化投研中的过拟合与幻觉风险,提出了职责解耦的Agent评估与治理机制,具工程参考价值。# 智能体# 金融科技# 统计检验# 应用工程
arXiv 人工智能✦ 精选AI 评分 72/10012:00

论文提出Policy-as-Skill:面向大模型决策支持的可治理与审计模块化运行时

针对企业利用大语言模型进行合规、风险及运营决策时对证据验证、审查路由与可审计性的高要求,研究人员提出了Policy-as-Skill(PaS)模块化运行时框架。该框架将上述功能打包为可执行且具备版本控制的策略能力。在基于固定模型后端的600项开发任务评估中,PaS+Audit方案取得了53.8%的准确率、100%的引用精确度与审计完整性,在绝大多数治理与合规指标上超越了传统LLM+RAG架构。

阅读原文 ↗推荐理由:将企业合规与治理规则工程化为可执行的AI技能运行时,显著改善了大模型决策的审计追溯与确定性控制能力。# 大模型# 决策支持# 治理# 合规审计# 智能体
arXiv 人工智能✦ 精选AI 评分 75/10012:00

基于大语言模型的可证明完备泛化规划方法

该研究针对泛化规划中方案完备性难以形式化验证的问题,提出了一种基于大语言模型(LLM)的新框架。此前利用 LLM 生成 Python 代码形式泛化规划的方法,只能依赖人工评估来确认其是否能解决领域内的所有实例。为此,研究团队提出利用交互式定理证明器 Lean 自动生成泛化规划,并同步产出基于领域约束规范的完备性数学证明,实现了对泛化规划正确性与全域覆盖能力的机器可验证保障。

阅读原文 ↗推荐理由:将大模型代码生成与 Lean 形式化证明相结合,解决了 AI 泛化规划完备性难以自动验证的关键难题。# 大模型# 泛化规划# Lean# 形式化验证# 自动推理
arXiv 人工智能✦ 精选AI 评分 75/10012:00

反思复杂拓扑:相异对等随机路由提升多智能体辩论成本效益

该研究探讨了大型语言模型多智能体辩论(MAD)中的通信拓扑问题。针对当前学术界倾向于设计复杂、自适应或动态重构交互拓扑以提升推理准确率的趋势,研究团队深入审视了稀疏通信机制。论文提出“相异对等随机路由”方法,旨在探究是否真的需要复杂的拓扑控制,证实简单的稀疏通信即可在显著降低成本的同时实现极具竞争力的推理性能,为优化多智能体交互架构提供了更具成本效益的新思路。

阅读原文 ↗推荐理由:针对多智能体协作中拓扑结构过于复杂的痛点,提出了高效低成本的稀疏交互解决方案,对大模型智能体工程落地具有实用价值。# 多智能体辩论# 大模型# 通信拓扑# 成本效益# 智能体系统
arXiv 人工智能✦ 精选AI 评分 75/10012:00

XLOG:面向神经符号集成的 CUDA 原生逻辑编程引擎

论文提出了用于神经符号集成的 CUDA 原生逻辑编程引擎 xlog。该引擎通过类型化前端与 CUDA 运行时,将神经感知与确定性 Datalog、概率推理及认知世界观相结合。各推理模式共享 GPU 设备数据平面,其中常驻递归与蒙特卡洛采样核心在特定推理阶段实现了零主机-设备数据传输开销。此外,其概率推理路径支持通过 GPU 知识编译完成端到端梯度计算,显著提升了神经符号推理的硬件执行效率。

阅读原文 ↗推荐理由:提出了一种面向神经符号推理的 CUDA 原生逻辑编程引擎,在 GPU 层面优化了符号逻辑与深度学习的集成效率。# 神经符号系统# 芯片# 概率推理# GPU加速
arXiv 人工智能✦ 精选AI 评分 75/10012:00

针对利益冲突环境,新基准CAVEAT评估计算机使用智能体鲁棒性

随着计算机使用智能体(CUA)日益广泛地代表用户执行在线操作,当所处环境的利益激励与用户目标不一致(如电商平台倾向于推荐特定商品而诱导智能体偏离目标)时,智能体表现面临新挑战。现有基准多局限于合作场景或显式攻击,忽略了环境自身存在利益诉求的情况。为此,研究团队推出了受控基准测试 CAVEAT,涵盖 9 个市场环境及相关分类法,专门评估智能体在利益错位环境下的目标坚守能力。

阅读原文 ↗推荐理由:针对计算机使用智能体在现实商业利益诱导下的对齐与鲁棒性问题,填补了现有评测基准的空白。# 智能体# CUA# 评测# 鲁棒性# 对齐