面向未观测混杂因素的鲁棒风险评分学习方法
该研究探讨了在存在未观测混杂因素的历史观测数据中学习风险评分的难题,此类评分通常用于指导稀缺资源分配或干预措施的优先级。尽管逆倾向加权等传统方法尝试校正观测数据带来的偏差,但在存在未观测混杂时仍面临严峻挑战。本研究旨在提出能够在混杂偏差下保持鲁棒性的评分学习方案。注:原始摘要文本末尾有所截断,具体方法细节未完全披露。
该研究探讨了在存在未观测混杂因素的历史观测数据中学习风险评分的难题,此类评分通常用于指导稀缺资源分配或干预措施的优先级。尽管逆倾向加权等传统方法尝试校正观测数据带来的偏差,但在存在未观测混杂时仍面临严峻挑战。本研究旨在提出能够在混杂偏差下保持鲁棒性的评分学习方案。注:原始摘要文本末尾有所截断,具体方法细节未完全披露。
该研究针对可解释性与表征学习中的“线性表征假说”提出了理论层面的反思。作者指出,要让关于表征的结论跨越具体训练模型实现泛化,必须明确两个表征何时被视为等价。由于现有讨论普遍缺乏对等价性的明确定义,导致看似研究同一表征的指标、探测器和干预手段实际上可能对应着不同的假设。研究认为,线性表征假说并非单一假设,而是由不同表征等价性所区分的一个假说家族。
针对现代大语言模型因海量预训练数据导致基准泄露、评估可靠性受损的问题,以及基座模型因指令遵循能力受限而难以通过任务型标准评估的挑战,研究人员提出了 Uncheatable Eval。该动态基准通过定期采集最新发布的文本来评估基座语言模型,以规避数据污染风险,并利用模型预测能力与文本压缩能力之间的关联设计评估机制。原摘要在方法细节处截断。
该研究探讨了大语言模型在推理任务中的“能力”(解题正确率)与“效率”(所需资源消耗)两个核心维度。当模型利用思维链(CoT)处理不同难度的问题时,正确率和所需Token数量均受问题难度与模型规模影响,但两者的联合作用机制此前尚不明确。研究采用分层贝叶斯方法建模分析,旨在揭示模型规模与问题难度如何共同影响推理期的能力与效率扩展。(注:原文摘要存在截断)
针对泰语缺乏用于定量句法研究的大规模自动解析语料库的问题,研究团队推出了 ThaiTrees。该语料库规模达 3.42 亿词元(tokens),涵盖新闻、维基百科、口语转录及社交媒体等多个领域。此外,研究人员在通用依存(Universal Dependencies)框架下构建了一套可复现的泰语文本清洗、预处理和句法解析流水线,为泰语的定量句法分析和语言学研究提供了有力的数据支撑。
结构映射通过对齐关系连接系统而非表层特征来形成类比推理。研究人员提出了名为紧界结构映射(SMTB)的新算法,相比经典的结构映射引擎(SME),其运行速度提升了5至15倍,在大型嵌套领域中发现映射的能力提高了约50%。SMTB是更广泛的认知规则引擎(CRE)项目的一部分,该框架通过友好的Python接口集成了顶尖的高性能C++认知系统核心算法。
在物理人工智能(Physical AI)领域,AI系统需兼顾高预测精度并保持动态系统的基本物理特性。为此,研究人员提出了一种深度离散时间耗散循环神经网络(DissipNet)。该网络通过结构化权重约束和专用训练算法,显式强化了耗散性这一关乎系统稳定性和能量耗散的关键物理属性,旨在提升对真实世界动态系统的建模、预测与控制能力。
监督式量子误差缓解通常需要理想输出来学习映射关系,但生成无噪声模拟的计算成本随系统规模呈指数级增长,导致其在大规模场景下无法适用。本研究提出一种弱监督量子误差缓解方案,探索利用电路结构和硬件校准中成本较低、单独不可靠的启发式信号来替代真实的理想标签。研究团队整合了包含稳定器、奇偶校验约束、弛豫及读出特性在内的16种启发式标注函数,用于构建有效的误差缓解模型。
针对去中心化零阶学习中稀疏通信面临的节点状态坐标对齐问题,该研究提出了 ZO-COSMO 算法。该方法结合了双查询梯度估计与保均值掩码共识机制,匹配更新仅需在通信节点对内部达成一致,消除了全局索引协调的需求。论文给出了严格的单标量收缩界,并为核心更新及稀疏动量更新提供了收敛性理论保证,有效降低了去中心化黑盒优化的通信复杂度。
针对大语言模型容易受对抗性群体共识影响而产生盲从(阿谀)现象的问题,研究人员提出了对比认知解码(CED)。不同于依赖弱辅助模型的传统对比解码,CED在单模型架构上通过双重前向传播来隔离从众偏见。该方法引入了新型非对称零边界概率钳位和离散Top-k截断掩码,在数学上抑制有害的从众Token生成且避免语法崩塌,为零样本推理阶段的模型自主性提供了有效干预手段。
序列推荐系统通过用户历史交互序列驱动下一步决策,是现代个性化服务的核心。基于CNN和Transformer的深度学习架构虽能有效捕获时序依赖,但其非线性特征导致模型沦为黑盒。为了提升模型透明度与信任度,帮助开发者审查模型行为并为用户提供推荐依据,该研究针对序列推荐系统中的时序归因可解释性方法展开系统化基准评估(注:原论文摘要结尾存在截断,具体评估结果详见完整论文)。
针对大规模图神经网络(GNN)训练中传统采样标准易忽略边几何角色的问题,本研究提出了一种由电阻曲率引导的高效子图采样框架。该方法依托面向大图的曲率近似算法 ERC-LG,结合 Johnson-Lindenstrauss 投影与多 GPU 批处理共轭梯度求解器,避免了昂贵的显式拉普拉斯伪逆计算和全局嵌入存储,能有效利用几何曲率指导节点与边的采样概率。注:原始摘要文本在实验部分存在截断。
该论文针对自动定理证明(ATP)中微调大语言模型的对齐问题展开研究。当前大模型常作为树搜索的引导策略,而传统交叉熵损失在搜索场景下并非最优。将对齐策略拓展至树搜索具有较大挑战,因为证明发现过程高度依赖监督演示中未包含的偏离轨迹状态的探索与恢复。为此,作者拓展了相关计算对齐方法以直接优化搜索生成器。注:由于原摘要结尾截断,更多技术细节尚未完整披露。
该研究聚焦于多元保形预测(CP)这一具备有限样本覆盖保证的无分布不确定性量化框架。针对现有最小体积方法依赖分位数阈值、忽略尾部残差严重性并将几何学习与覆盖水平隐式绑定的问题,研究团队提出了一种用于保形椭球的尾部感知几何学习框架。该方法成功将几何学习中的尾部敏感性与最终覆盖保证解耦,从而提升了多元预测集的构建效率与几何表征能力。
针对功能性磁共振成像(fMRI)基础模型中数据规模、模型大小与算力关系尚不明确的问题,研究团队进行了一项系统性的对照实证扩展研究。该研究汇聚了超过200个源数据集的预训练数据,消耗逾10,000个GPU时。在固定预训练框架与下游评测协议的条件下,系统探究了数据量、参数量和训练时长的协同变化规律,结果显示下游任务性能总体上随着计算量的增加而提升。
该研究探讨了Transformer架构在序列排序判断任务中的表达能力。论文证明,判断一个比特序列是否处于有序状态的任务无法由单头单层(1-head 1-layer)Transformer完成,但可以通过双头单层(2-head 1-layer)Transformer实现。与以往同类理论成果不同的是,该研究的结论建立在模型包含输出多层感知机(MLP)的架构设定之下。
针对 AI 虚拟细胞模型在预测生物干预响应时可能并未真正利用输入信息的“预测-主张差距”,研究团队提出了审计框架 CELLAUDIT。在大模型智能体自动发现和迭代预测模型的场景下,CELLAUDIT 从源码计算路径、拟合依赖性以及实际预测贡献三个维度切入,系统性验证模型对输入扰动信息的使用主张是否属实,以确保智能体生成的科学预测模型具备真正的因果有效性和可靠性。
该研究提出了一种面向在线自适应的贝叶斯神经网络训练方法。研究将神经网络各层视为状态空间模型的时间步,把贝叶斯训练转化为平滑问题:前向过程传播高斯矩,反向 RTS 平滑过程则以闭式解更新权重后验。这种方法单次遍历即可完成学习,具备不确定性感知能力,且无需梯度迭代或经验回放,非常适用于高数据效率的在线自适应场景。针对以往方法受限于激活对角协方差的瓶颈,该工作展开了全协方差平滑研究。
针对自回归语言模型仅能通过序列分解间接表示全局结构、缺乏类似图像领域的忠实连续表征这一问题,研究人员提出了LLMAE方法。该方法将预训练的仅解码器(decoder-only)大语言模型重新利用为连续文本自编码器,通过在其内部激活状态中构建一个中间固定长度的潜在瓶颈(latent bottleneck),成功为文本生成提供了可操作的高保真连续潜空间表征。
柏拉图表征假设提出高能力模型会趋向于收敛至共享表征,而近期研究将其范围缩减为共享局部邻域关系,并认为校准后全局相似性趋势大多消失。该研究对这一解读提出质疑,指出以往的局部与全局对比混淆了结构尺度(局部与全局)与对比对象本身的差异,即由样本关联定义的“关系结构”和由距离等量化关系表征的“度量几何”被混为一谈,重新澄清了模型表征收敛的实质。
MentalHealthBench is an expert-informed benchmark for evaluating helpful and safe AI responses across realistic mental health conversations.
最卷一夜! #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。
DeepSeek 的价格护城河,迎来 OpenAI 的挑战 #欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。
GPT-6 Sol and GPT-6 Luna are now generally available on Amazon Bedrock, giving you more options to match intelligence and efficiency to each workload.
Meet GPT-6 Sol and Luna, two models that bring frontier intelligence to everyday work with different balances of capability and cost.
Claude Opus 5.5, Anthropic's most capable Opus model for agentic coding, knowledge work, and long-running tasks, is now available on Amazon Bedrock and Claude Platform on AWS. This post covers what's new in Opus 5.5, practical guidance, and how to start building with the model on Amazon Bedrock.
v0.30.0 Highlights This release features 762 commits from 315 contributors (104 new)! New models : DeepSeek-V4.1-Flash ( #56214 , #56228 , #56208 ) with the whole KV stored in MXFP8 through the FlashMLA V4.1 record on SM100 ( #56893 ), DeepGEMM Mega-mHC ( #56962 ), and async Engram prefetch with Engram DP sharding ( #56512 ); DeepSeek-V4-Flash-Vision-Exp ( #54566 ), also on ROCm ( #55107 ) and with LoRA ( #55897 ); GLM-5.3-Flash ( #53906 ) with EPLB ( #55119 ); K2-Horizon ( #55063 ); Cohere Compass ( #54774 ); Bailing V3 VL ( #55921 ); Nanbeige4.2 via the Transformers backend ( #56071 ); and a DeepSeek-V4 CPU backend with AVX512/AMX sparse ML