息壤开物完成数亿元融资,华为大模型背景团队发力Physical AI底座
由原华为大模型团队成员创立的Physical AI企业息壤开物,近日连续完成数亿元种子轮及天使轮融资,目前估值达5亿美元。本轮融资由敦鸿资产领投,华控基金、三花控股、银杏谷资本等机构跟投。募集资金将主要用于原生物理AI模型的规模预训练、真实物理交互数据建设、核心研发人才引入及场景验证,旨在重塑物理AI底层能力。
由原华为大模型团队成员创立的Physical AI企业息壤开物,近日连续完成数亿元种子轮及天使轮融资,目前估值达5亿美元。本轮融资由敦鸿资产领投,华控基金、三花控股、银杏谷资本等机构跟投。募集资金将主要用于原生物理AI模型的规模预训练、真实物理交互数据建设、核心研发人才引入及场景验证,旨在重塑物理AI底层能力。
据媒体报道,继阿里推出千问办公、字节跳动上线豆包工作之后,百度在AI办公赛道也有新动作,正式推出名为“OkWork”的产品,旨在瞄准碎片化AI办公场景。目前素材信息有限,尚未披露该产品的具体功能形态与上线节奏,但这一举措标志着国内科技巨头在AI协同办公与垂直生产力应用领域的竞争进一步加剧。
灵初在机器人训练领域提出不能仅靠增加训练时长,而应严控数据质量,其核心目标在于解决机器人学习中人机动作无法精准对齐的问题。通过提升动作数据的质量与映射精度,助力机器人更高效地掌握作业技能。由于目前公开素材信息有限,关于其具体采用的数据清洗流程、算法模型以及实际落地的硬件验证等细节尚待进一步补充披露。
在外滩大会上,北京大学关于“长程任务学习”的合作研究引发关注,探讨AI从单次问答迈向长周期复杂任务时,模型如何通过持续交互实现进化积累。沐晨科技作为合作方参与其中,依托训练数据与科研验证能力,押注并构建面向复杂交互场景的AI新型基础设施,助力前沿模型演进。
该内容围绕相关前沿学术动态展开复盘,探讨从三维视觉向世界模型演进的技术主线。文章指出,当前人工智能的发展正从单纯理解平面画面的感知阶段,迈向能够理解三维空间、预测环境动态变化并执行动作的认知与行动阶段,空间智能因而成为 AI 融入物理世界的关键枢纽。由于现有素材信息较为精炼,更多会议复盘的具体模型细节与前沿论文分析仍有待进一步展开。
9月18日,亚马逊云科技宣布其大模型服务平台Bedrock正式托管国产开源模型Kimi K3。尽管国产模型上线海外云平台此前已有先例,但作为开源模型直接吸引美国主流云厂商采购付费尚属罕见。此举标志着中国开源大模型的技术实力与应用价值进一步获得硅谷云巨头的商业认可,也展现了海外云厂商围绕优质开源模型开展商业化合作的新动向。
IQuest Research 联合北京航空航天大学、曼彻斯特大学等研究团队发布了 ModularRSI。该方案探索了一种在冻结模型权重的前提下让 Agent 持续进化的新途径,其核心机制在于允许 Agent 根据自身的执行经验,动态修改并优化大模型外围的运行机制(Harness),从而实现智能体系统的持续自我改进。
清华大学联合无问芯穹正式开源具身智能云原生平台RLark,旨在打造具身智能基础设施的新“塔台”。该平台支持高效的机器人设备管理与调度,可实现5分钟内完成机器人纳管,并在10秒内快速启动跨集群任务,为具身智能应用的大规模部署和跨集群高效协同提供了底层云原生支撑。
针对单一大型语言模型在处理复杂查询时可靠性不足的问题,现有多模型系统通常采用路由分发或密集全量协作。但研究表明,模型协作具有非单调性,引入同行模型在纠正错误的同时也可能破坏已有的正确结果。为此,研究团队提出了COMED机制,作为一种后锚点控制器实现受控的模型升级协商,介于单纯路由与全量协作之间,通过选择性触发跨模型协同来兼顾推理准确率与计算效率。
针对大规模文本标注中编码规范(Codebook)构建耗时漫长的问题,该研究提出利用大语言模型(LLM)加速这一流程。方法通过在早期将编码本应用于数据,筛选出多个LLM之间存在显著分歧的疑难样本,从而精准引导专家介入并提供针对性反馈。研究探讨了多种专家反馈形式,包括直接编辑由跨模型分歧驱动生成的修改方案,以及解答模型争议问题等,有效提升了人机协同标注与规范迭代的效率。
当前针对大语言模型在多语言亲属关系理解上的评估多采用多项选择,实质将其简化为识别任务。该研究构建了涵盖印地语、泰米尔语和韩语三种非西方语言的亲属称谓生成基准,测试了5款开源大模型在生成与选择任务中的表现。结果显示,模型普遍存在显著能力断层:GPT OSS 120B在对应选项识别中准确率达90.67%,但在自主生成中的合格率仅为36.00%,Llama 3.3 70B等模型亦呈现相同趋势。
针对大语言模型在司法推理分析中的难点,该研究提出了一个句子级基准,用于评估大模型分类法律解释准则的能力。研究基于传统法学解释理论构建了分类标准,发布了经过句子级人工标注的德国联邦宪法法院判决数据集,并在专家手写提示词设定下,对来自三个模型家族的四款大语言模型进行了基线性能评测。
该论文针对长文本多项选择问答任务,系统测试了学习型上下文规划在强检索、路由、预算选择和重排序控制下的有效性。研究人员基于LongBench-v2的503道多选题目,使用Qwen2.5-7B-Instruct模型进行了对照诊断。结果显示,在18k字符的预算约束下,锚定混合检索可达到36.18%的准确率,揭示了复杂的上下文规划在面临强检索基线时的局限性与表现瓶颈。
针对大语言模型在复杂法律推理中面临的结构性挑战,研究人员提出了LEGO框架。传统RAG及GraphRAG往往侧重词汇或语义相似度,忽略了法律条文间的规范关系;而普通思维链提示易生成缺乏法律规范结构的推导过程。LEGO采用双模块架构,将法律专家GraphRAG与专家级思维链相结合,有效规范了法律条文检索与逻辑推理链路,旨在突破高风险法律领域的推理瓶颈。
在法律文本摘要中,真实性至关重要,因而通常采用内容可溯源的抽取式方法。但现有方法多孤立评估段落等结构单元,忽视了长距离分散证据的有效整合。研究人员提出抽取式摘要模型 LexLattice,将法律文书的层级结构具象化为二维语义网格,并在选择文本前利用带掩码的二维神经元胞自动机对其进行跨区域特征整合,以改善证据整合能力与摘要质量。
大语言模型已被广泛应用于教育对话数据的教学构念标注与分类,但其黑盒推理特性导致难以验证模型对具体话语分类的机理依据。为此,研究团队提出了 EduBehaviors 框架。该框架是一种可解释且具扩展性的教育数据标注方案,通过利用大语言模型量化与多种构念相关的可观测重复行为,进而训练下游分类器,实现标注过程的可追溯与审计(原摘要结尾略有截断)。
当前营销领域常使用大语言模型构建“虚拟人设”以预测真实受众对文案的反应。本研究基于Upworthy研究档案中数千次真实流量点击率A/B测试作为基准,开展了从模拟到真实的有效性检验。实验对比了基于真实人口统计特征构建的10人虚拟人设面板与无角色设定的基准模型,结果显示,无角色基准在文案效果模拟上的表现反而击败了基于人设的模拟,对当前AI受众模拟的有效性提出了质疑。
研究人员推出了伊利诺伊社会态度综合语料库(ISAAC)及其可复现的处理流水线。该语料库汇集了2007年至2023年间超过5.27亿条英文Reddit帖子,重点围绕种族、性取向、年龄、身体能力、体重和肤色六大社会群体维度。通过多步骤的人工审计过滤流程,各分类的不相关内容比例均控制在10%以下,并且每条帖子均通过算法标注了用户的推断居住区域等元数据,为大规模分析社会群体话语提供了开放工具。
局部学习通过各层独立的辅助损失避免了全局反向传播,具备天然的结构并行优势,但长期受困于深度增加时的精度衰减和超参数脆弱性。该研究首次将类似 Muon 的谱更新几何(包含动量正交化与谱步长缩放)应用于逐层局部更新。在 CIFAR-10 MLP 基准测试中,该方法在深度 12 至 48 层、宽度 128 至 2048 的范围内,仅需单一固定步长即可取得最优表现,显著提升了局部学习对网络深度的鲁棒性。
针对结构化生物医学数据分析,表格基座模型展现出巨大潜力,其中TabPFN在小样本表格分类任务中表现尤为突出。然而,优化和预条件策略对生物医学场景微调的影响尚缺乏研究。本文对TabPFN v2.5展开系统性实证评估,在涵盖阿尔茨海默病、乳腺癌、精神分裂症等疾病及KEEL库的59个生物医学数据集上,测试了五种基于AdamW的预条件策略,为优化生物医学表格基座模型微调提供了实验参考。
该论文探讨了联合事实核查评分提升背后的机制,分析在固定答案的前提下证据质量对综合评分的独立贡献。研究基于FEVEROUS基准数据集中的7,890条声明及4个DeBERTa模型检查点展开实验。结果显示,将DCUF证据替换为UnifEE证据后,严格核查评分显著提升9.61个百分点,而答案准确率仅提高1.96个百分点。该研究通过细粒度归因,揭示了高质量证据检索对联合事实核查评估指标的决定性影响。
针对心电图(ECG)和脑电图(EEG)等生理时间序列在复杂时序结构与高决策透明度方面的需求,现有深度学习模型往往缺乏对异常原因及局部关联的可解释性。研究团队提出了一种名为 Signal2Symbol 的神经符号框架,旨在实现可解释的生物信号异常检测。该方法首先将连续的生理信号转化为符号序列,进而结合神经符号时序推理,提升检测决策的透明度与规律挖掘能力。
动态高斯泼溅能显式表征随时间演化的3D场景,但现有方法多针对重建、未来状态生成或渲染进行优化,缺乏对可复用预测动力学的学习。对此,研究人员提出了 4DGS-JEPA,一种用于动态高斯场景因果多时域预测的原生联合嵌入预测架构。该模型构建了涵盖场景级、运动群级及高斯级的层次化表征,并结合时域条件转移算子,能够同时支持直接预测与递归推演。
NADI 2026 是精细阿拉伯语方言识别(NADI)系列的第七届共享任务,也是第二次专注于多方言阿拉伯语语音处理的评测。本届任务包含五项核心任务与八个子任务,覆盖自动语音识别(ASR)、方言识别(SDID)、语音合成(TTS)、语音翻译(SLT)和口语理解(SLU)。该评测重点关注低带宽、混合方言、语码转换、域外及零样本等真实场景,并首次在该系列中引入了 TTS、SLT 和 SLU 赛道。
针对金融时间序列在多时间尺度预测中重复计算不变表征的难题,研究者提出了分层联想共振网络(HARN)。该模型专为事件驱动的多周期预测设计,通过在不同时间层级维护持久化表征,仅在对应周期的K线数据生成完成后才触发该层更新,显著避免了冗余计算。其架构综合了因果多尺度时间编码、门控联想记忆、跨层级共振以及分层证据聚合机制。
针对多形性胶质母细胞瘤(GBM)生存预测对高准确度和透明度的双重需求,研究人员指出现有方法往往在性能与可解释性间妥协,且过度依赖单一成像模态,未能充分利用互补信息。该研究提出一种超图神经网络方案,认为这两者并非固有冲突,旨在利用图神经网络的结构优势,在保证强判别能力的同时提取具解释性的特征表征,以提升多模态临床预测能力(原文摘要截断)。
针对大语言推理模型常生成正确却冗长低效的推理链问题,现有优化方法多依赖轨迹级或局部标记信号,未能充分建模步骤间的语义依赖,导致难以有效区分冗余步骤与关键支撑步骤。研究团队提出了 RECAP(通过传播实现的冗余感知信用分配)方法。该方法基于推理步骤在后续推导中的实际下游作用精准分配信用,从而在确保模型推理准确率的前提下精简推理过程,显著提升推理效率。
前沿基准测试常依赖当前模型无法解决的任务来衡量能力边界,但零通过率并不等同于真正的高难度。该研究指出,任务全军覆没既可能源于真实的能力代差,也可能是由缺失上下文、损坏的参考方案或基础设施故障等“虚假难度”导致。基于 Terminal-Bench 3 等基准中涵盖 639 个任务、2.8 万余次试验及逾 10 万美元开销的真实记录,研究系统性厘清了导致智能体任务失败的本质原因,为评测体系纠偏。
该研究推出了全模态嵌入模型家族 Ovis-Embedding,实现对文本、图像、视频和音频的原生整合。不同于将各个独立的模态塔简单组合,Ovis-Embedding 采用共享的多模态骨干网络,将不同模态编码至统一的表征空间中。该模型以预训练的 Qwen-omni 为骨干网络,通过低秩初始化的对比训练完成适配,并引入了以数据为中心的全模态训练策略。
在利用大语言模型评估社交媒体长文本的公众价值取向时,文本通常夹杂背景信息、引用及少数关键立场句。现有方法直接预测篇章标签易导致过度自信,而传统的句子级聚合投票则忽视了句子间置信度的差异。为此,研究团队将长文本价值测量构建为决策融合问题,并提出了无需训练的“回火证据融合”(TEF)方法,旨在更有效地聚合模型判断并提升长文本价值衡量的准确性。