DCAI
DC AI 热点

全部 AI 动态

9月25日2026-09-25
InfoQ · 架构与云计算AI 评分 30/10000:34

数据、模型、算力深度融合,探讨 Data+AI 基础设施演进路径

本文讨论了在当前人工智能技术发展背景下,数据、模型与算力日益紧密结合的行业趋势,探讨 Data 与 AI 融合基础设施的未来演变方向。由于当前输入素材仅包含文章标题,未提供正文或详细摘要,关于数据平台演进、算力协同优化以及具体技术实现路径等实质性细节均缺乏明确信息,完整内容需查阅原文。

阅读原文 ↗推荐理由:探讨了数据与AI基础设施融合的前沿话题,但输入信息严重不足。# AI基础设施# 数据工程# 算力协同# 大模型
9月24日2026-09-24
InfoQ · 架构与云计算AI 评分 50/10021:44

大模型价格战新趋势:竞争重心从API定价转向实用性与综合性价比

本文探讨了大模型领域的最新商业竞争态势,指出当前模型价格战已不仅局限于单纯的API接口定价,而是转向兼顾易用性与综合落地体验。文中提及以GPT和Claude Opus等为代表的前沿模型在降价与产品优化方面的动向。由于原始输入素材正文缺失,关于各厂商具体的调价幅度、产品更新细节及深层商业策略等内容尚不充分。

阅读原文 ↗推荐理由:聚焦大模型商业竞争格局与价格战演进路径,具有一定的行业观察价值,但受限于输入素材信息不足。# 大模型# 价格战# API定价# 商业生态# AI竞争
AITNT · AI头条(网页)✦ 精选AI 评分 60/10013:57

两周一次迭代且千元起步,有初创团队致力于降低大模型后训练门槛

近期后训练已成为大模型领域备受瞩目的核心议题。有企业推出低门槛的后训练服务,旨在通过两周一次的高频迭代节奏以及1000美元起的亲民价格,推动后训练技术向更广泛的开发者普及,实现“人人可用”。由于当前所获素材信息较为有限,关于该公司的具体技术路线、优化机制以及完整商业服务形态等细节,仍有待进一步披露。

阅读原文 ↗推荐理由:反映了大模型后训练技术正朝着低成本、高频迭代与平民化方向发展的趋势。# 大模型# 后训练# 模型微调# 模型服务# 技术普及
arXiv 机器学习✦ 精选AI 评分 78/10012:00

终端基准测试何以称“难”?研究揭示智能体评测中的“真假难度”陷阱

前沿基准测试常依赖当前模型无法解决的任务来衡量能力边界,但零通过率并不等同于真正的高难度。该研究指出,任务全军覆没既可能源于真实的能力代差,也可能是由缺失上下文、损坏的参考方案或基础设施故障等“虚假难度”导致。基于 Terminal-Bench 3 等基准中涵盖 639 个任务、2.8 万余次试验及逾 10 万美元开销的真实记录,研究系统性厘清了导致智能体任务失败的本质原因,为评测体系纠偏。

阅读原文 ↗推荐理由:通过大规模实证分析揭示了智能体基准评测中零通过率背后的工程与设计缺陷,对规范 Agent 评估体系具有重要参考意义。# 智能体# 基准测试# Terminal-Bench# Agent评测# 大模型
arXiv 人工智能✦ 精选AI 评分 75/10012:00

大模型智能体缺乏人情世故?新研究提出关系社交推理框架ReAdapt

该论文指出当前大模型智能体在社交决策(如是否互动或联系谁)中,往往仅关注内容显著性而忽略人际间的潜在关系(如关系强度、互惠性等)。现有的智能体循环无法根据新关系证据动态调整社交假设,导致在关系与内容线索产生分歧时做出表面化选择。为此,研究团队形式化了这种失效模式,并提出了包含500个样本的关系推理基准测试及ReAdapt方法,以提升智能体的社交推理能力。

阅读原文 ↗推荐理由:针对大语言模型智能体在复杂社交关系推理上的痛点,提出了新的基准与应对方法。# 大模型# 智能体# 社交推理# ReAdapt# 人际关系
arXiv 人工智能✦ 精选AI 评分 75/10012:00

RAG-NAROK:面向检索增强生成的检索感知型知识库投毒攻击

针对检索增强生成(RAG)系统的安全漏洞,该研究指出当前架构对动态检索流水线的依赖带来了新型对抗风险。现有知识库投毒攻击大多采用静态预设注入,未考虑受害系统在面对具体查询时的实际检索内容。为此,论文探索了具有检索感知的投毒机制,分析攻击者如何利用特定源反驳等手段在竞争性检索环境中提升攻击效果,揭示了RAG系统潜在的安全隐患。

阅读原文 ↗推荐理由:揭示了RAG系统在动态检索环境下易受感知型投毒攻击的新型安全脆弱性。# RAG# 知识库投毒# AI安全# 对抗攻击# 大模型
量子位AI 评分 45/10008:48

成立九年,中科类脑将积累注入“Token工厂”

报道聚焦于成立九年的中科类脑公司,指出其将过往的技术与业务积累整合并投入到“Token工厂”的建设与布局中,暗示其在大模型时代围绕算力资源与Token生成服务进行的转型与探索。由于输入素材未提供详细正文或摘要内容,关于该“Token工厂”的具体技术架构、产品形态、商业落地细节及最新进展等信息尚不明确,有待后续报道补充。

阅读原文 ↗推荐理由:展示了类脑AI企业向大模型算力与Token基础设施转型的动态,但缺乏正文细节。# 中科类脑# Token工厂# 算力基础设施# 大模型# 商业动态
InfoQ · 架构与云计算✦ 精选AI 评分 65/10006:41

Claude Opus 5.5 发布:支持极速代码迁移且成本降低80%

原素材正文信息不足,仅包含原文跳转提示。据标题信息,Claude Opus 5.5 模型正式发布,展示了突出的代码工程能力,可在一天内完成 68 万行代码的迁移任务。此外,该模型在成本效益上表现亮眼,其单任务使用成本相较于 GPT-6 Astra 降低了 80%。具体技术细节与架构改动待进一步披露。

阅读原文 ↗推荐理由:披露了新模型的发布动态,重点展示了极高的大规模代码迁移效率与显著的推理成本优势。# Claude# 代码迁移# 大模型# AI成本# AI开发
9月23日2026-09-23
OpenAI 官方动态✦ 精选AI 评分 65/10018:00

心理健康对话评估基准 MentalHealthBench 正式发布

MentalHealthBench 是一项由专业人士参与制定的新型评估基准,专门用于评测人工智能在真实心理健康对话场景中生成回复的有效性与安全性。该基准针对高敏感度的人机心理交互需求,为检验大模型在心理健康支持场景下的临床安全界限和实用价值提供了标准化评估工具,有助于推动垂直领域 AI 的安全对齐。

阅读原文 ↗推荐理由:填补了心理健康高危场景下专家级 AI 安全与有效性评测基准的空缺。# 心理健康# AI安全# 基准评测# 大模型# 安全对齐