DCAI
DC AI 热点

全部 AI 动态

9月25日2026-09-25
IT之家 · AI 筛选✦ 精选AI 评分 68/10017:11

IMF报告:全球私营部门AI投资规模或将突破2万亿美元

国际货币基金组织(IMF)最新年报指出,人工智能已成为推动全球生产率和投资增长的核心力量。外部估算显示,到2026年全球由私营部门推动的AI投资规模或将突破2万亿美元。AI相关投资在2025年预计为美国GDP增速贡献0.5个百分点。同时,亚洲积极抢抓AI机遇,东亚与东南亚分别在芯片与制造端发力。但IMF也预警称,AI可能加剧劳动力市场结构性分化,中等技能岗位面临自动化冲击风险。

阅读原文 ↗推荐理由:IMF权威发布的宏观经济与AI产业投资报告,系统性评估了AI对全球GDP、就业市场与芯片供应链的深远影响。# 投融资# 治理# 算力# 芯片
IT之家 · AI 筛选✦ 精选AI 评分 75/10012:57

报告称1b DRAM晶圆单位成本较台积电N2溢价54%

韩国分析机构Kernel Insight数据显示,采用亚10纳米工艺的1b DRAM晶圆每平方毫米成本达0.654美元,较台积电2纳米(N2)晶圆的0.424美元高出54%。1b DRAM主要用于高规格服务器内存及HBM3E等AI硬件专用存储颗粒。尽管其制造复杂度理论上低于先进制程逻辑芯片,但受市场供需与短缺影响,当前晶圆单位面积成本出现了罕见的倒挂现象。

阅读原文 ↗推荐理由:揭示了先进制程存储与逻辑晶圆成本的倒挂现象,反映出内存供应链紧张对服务器及算力硬件成本的直接影响。# 芯片
IT之家 · AI 筛选AI 评分 55/10012:28

开发者借助 Claude 约 1 小时从零构建 RTX 加速路径追踪器

据 Reddit 社区用户分享,其借助 Anthropic 的 Claude 模型(帖中称 Claude Opus 5.5),仅耗时约 1 小时便从零开发出一款实时硬件加速路径追踪器。该程序编写了 C++ 和 CUDA 代码库,并结合 NVIDIA OptiX 调用 GPU 专用 RT 核心与 Tensor 核心,支持多种材质与光照模拟。这一案例体现了前沿大模型在免除深厚图形学 API 知识背景下,辅助完成复杂高性能计算与图形编程任务的潜力。

阅读原文 ↗推荐理由:展示了大语言模型在复杂图形渲染与 CUDA 硬件加速编程任务中的强大工程代码生成能力。# Claude# AI编程# 芯片# 路径追踪# 图形渲染
AITNT · AI头条(网页)✦ 精选AI 评分 75/10010:13

盘点梁文锋署名技术论文:聚焦底层架构与核心算子创新

该文梳理了梁文锋在学术论文中的署名脉络。过去三年中,梁文锋极少作为第一作者或通讯作者出现在动辄上百人署名的旗舰模型整体报告中,而是将研究精力与署名重点投向最底层的原子技术,包括MLA注意力机制、MoE路由机制、mHC拓扑流形、DSpark推理算子以及DSec智能体沙盒等关键底层技术论文,展现了其对AI基础架构研发的深耕。

阅读原文 ↗推荐理由:梳理了梁文锋在MLA、MoE路由等关键底层模型架构与算子上的核心技术论文贡献。# 模型架构# MLA# MoE# 芯片
Google Developers · AI 筛选✦ 精选AI 评分 80/100收录 08:49

基于MaxText在TPU上复现OLMo 3 7B预训练:大规模训练案例研究

MaxText团队利用JAX/XLA在谷歌云TPU上从零成功复现了AI2的OLMo 3 7B大模型,在预训练及中期训练阶段的保留评估指标均精准对齐原PyTorch-GPU基准。该方案实现了高达57.4%的模型算力利用率(MFU),并在中途集群扩缩容及跨代TPU迁移中展现出极高鲁棒性。此外,团队通过保留验证发现并修复了导致训练损失虚低的数据加载器隐性记忆漏洞,验证了完备评估机制的重要性。

阅读原文 ↗推荐理由:展示了在Google Cloud TPU上跨生态、高算力利用率复现主流开源大模型的基础设施工程实践。# 芯片# MaxText# OLMo 3# 大模型预训练# 算力
Google Developers · AI 筛选✦ 精选AI 评分 80/100收录 08:49

Google Cloud 在 vLLM 中原生支持 TPU,优化长上下文多模态嵌入推理

Google Cloud 已将 TPU 原生支持集成至开源推理框架 vLLM,开发者可通过 GKE 弹性扩展嵌入模型流水线。针对 Qwen3-Embedding-8B 等模型的 15K+ 超长上下文推理,工程团队引入了硬件安全张量对齐、JAX/XLA 编译预热及分块预填充的混合 StepPool 架构等专项优化,在实现与 GPU 基线近乎一致的数值精度的同时提升吞吐,相关配置方案已在 GitHub 开源。

阅读原文 ↗推荐理由:vLLM 原生集成 Google Cloud TPU 并在超长上下文嵌入推理上实现硬件级深度优化,对异构算力基础设施生态建设具有重要参考价值。# Google Cloud# 芯片# vLLM# 推理# GKE
爱范儿 · AI 筛选AI 评分 35/10008:24

科技早报:Google计划将TPU送入太空测试,多项软硬件动态发布

本期早报汇总多项软硬件科技动态。算力与基础设施方面,Google计划下周将TPU芯片送入太空轨道,测试其在极端太空环境下的运行条件;应用与生态方面,腾讯WorkBuddy上线微信小程序生成与发布能力,网易云音乐鸿蒙版正式上线;商业动态上,任正非再次重申华为不造车的立场,腾讯QClaw将停运。此外,尼康发布了新款全画幅相机。

阅读原文 ↗推荐理由:综合资讯早报,信息碎片化且主题分散,仅Google TPU太空测试具备一定算力话题度。# Google# 芯片# 鸿蒙# 腾讯
Cerebras 官方博客(网页)✦ 精选AI 评分 85/100收录 07:49

Cerebras推出CS-4晶圆级AI加速器:推理速度号称达GPU系统的30倍

Cerebras正式发布新一代晶圆级AI加速芯片系统CS-4,宣称其为业内速度最快的AI加速器。根据官方介绍,CS-4的推理速度相比传统GPU系统最高可提升达30倍,支持原生解耦推理架构,并能提供更高的处理吞吐量,旨在应对大规模AI工作负载对算力与延迟的苛刻要求。

阅读原文 ↗推荐理由:Cerebras发布新一代旗舰晶圆级AI芯片CS-4,主打大幅超越GPU的超高速AI推理吞吐性能。# Cerebras# CS-4# 芯片# 硬件加速# 推理
Cerebras 官方博客(网页)✦ 精选AI 评分 75/100收录 07:49

Cerebras 实现 GPT-5.6 Sol 高速推理:输出速度达每秒 750 tokens

文章介绍了 Cerebras 如何在不压缩模型规模、不牺牲模型智能水平的前提下,为 OpenAI 的 GPT-5.6 Sol 模型提供超高速推理服务。通过其特有的硬件架构与加速方案,该系统的模型输出速度最高可达到每秒 750 个 token,展示了 Cerebras 算力平台在大模型超低延迟生成和高吞吐服务方面的技术实力。

阅读原文 ↗推荐理由:展示了专用 AI 芯片架构在超大规模模型推理上的极速生成能力,具备显著的性能参考价值。# Cerebras# 大模型# 芯片# 推理# 算力
Cerebras 官方博客(网页)✦ 精选AI 评分 80/100收录 07:49

Cerebras在Hot Chips大会详解CS-4系统与未来推理路线图

在Hot Chips 2026大会上,Cerebras详细介绍了其最新的CS-4系统和Nexus平台,并公布了后续CS-5与CS-6的硬件路线图。这些架构设计旨在为前沿大模型推理提供更高速、更高效率的算力支撑。通过持续演进的晶圆级芯片与系统集成方案,Cerebras进一步展示了其在超大规模AI推理基础设施方面的技术规划。

阅读原文 ↗推荐理由:Cerebras披露了最新的CS-4及后续芯片路线图,对AI超大规模推理算力架构的演进具有重要参考价值。# Cerebras# 芯片# 推理# 算力# 硬件路线图
Cerebras 官方博客(网页)✦ 精选AI 评分 75/100收录 07:49

Cerebras运行Kimi K2.6实测:推理速度达Gemini Flash五倍

根据性能对比测试,在 Cerebras 算力平台上运行的开源模型 Kimi K2.6,在智能水平上可比肩 Google Gemini 3.5 Flash。依托 Cerebras 晶圆级硬件加速架构,Kimi K2.6 的推理输出生成速度达到了后者的 5 倍,且具备更低的访问延迟和开源权重模型的部署灵活性。

阅读原文 ↗推荐理由:展现了 Cerebras 专用算力芯片在大模型超高速推理场景下的显著加速与低延迟优势。# Cerebras# Kimi# Gemini# 芯片# 大模型
Cerebras 官方博客(网页)✦ 精选AI 评分 75/100收录 07:49

Cerebras 布局主权 AI:依托 CS-4 晶圆级芯片提供超快推理算力

文章阐释了主权 AI(Sovereign AI)的概念及其对各国的重要性,并介绍了芯片公司 Cerebras 如何助力国家级算力建设。Cerebras 依托其超大晶圆级芯片提供强大的 AI 推理能力,其推出的 Cerebras CS-4 系统宣称推理性能最高可达传统 GPU 的 30 倍,旨在为主权级 AI 基础设施提供自主、高效的硬件底层支持。

阅读原文 ↗推荐理由:Cerebras 结合主权 AI 趋势推广其 CS-4 晶圆级芯片,展现了非 GPU 架构在国家级算力与高速推理场景中的竞争态势。# Cerebras# 主权AI# 芯片# 算力# 推理
Cerebras 官方博客(网页)✦ 精选AI 评分 78/100收录 07:49

Cerebras为企业提供万亿参数推理支持,Kimi K2.6实测达981 token/秒

Cerebras宣布在其企业级测试中支持Kimi K2.6超大模型的极速推理,实测输出速度达到每秒981个Token。该方案旨在通过其专有算力芯片解决大模型推理的吞吐与延迟瓶颈,支持实时智能体编程及其他万亿参数级别的复杂AI工作负载,加速超大规模模型在企业级生产环境的高性能落地。

阅读原文 ↗推荐理由:Cerebras展现了其晶圆级芯片在超大参数模型上的极端推理吞吐表现,对低延迟企业级算力架构极具参考价值。# Cerebras# Kimi# 芯片# 大模型# 算力
IDC 圈·云与算力(网页)✦ 精选AI 评分 68/100收录 07:48

马来西亚雪兰莪州推动数据中心采用30%本地供应链,扶持本土IC设计产业

马来西亚雪兰莪州正迎来数据中心基础设施的快速扩张。当地提出推动数据中心项目采用至少30%的本地供应链,旨在借助这一轮算力基建投资浪潮,带动本土半导体及信息技术生态发展,为当地集成电路(IC)设计公司等高附加值产业创造切实的新增市场需求与合作机会。

阅读原文 ↗推荐理由:展现了东南亚算力基建热潮中地方政府通过本地化采购配额扶持本土半导体产业的政策动向。# 数据中心# 马来西亚# 算力# 供应链# 芯片
Ars Technica · AI 筛选✦ 精选AI 评分 75/10000:16

谷歌首个 Suncatcher 轨道数据中心测试将于 10 月 1 日发射

谷歌计划于 10 月 1 日启动其名为“Suncatcher”的首个轨道数据中心实验测试。据介绍,该实验性太空数据中心将配备四颗谷歌自研 TPU(张量处理单元),受限于当前环境与能源等条件,系统单次仅运行 15 分钟。该项目旨在探索将 AI 计算硬件部署至太空轨道的可行性,为未来在极端环境下构建和运行算力基础设施积累关键测试数据。

阅读原文 ↗推荐理由:谷歌开启将 TPU 算力送入太空轨道的先驱测试,探索未来空间数据中心的可行性。# Google# 轨道数据中心# 芯片# 算力# 太空计算
Google Developers · AI 筛选✦ 精选AI 评分 75/100收录 00:15

基于 Tunix 与 TPU 的自主大模型后训练框架 autofinetune 推出

autofinetune 项目推出了一套全自动大模型后训练研究闭环,涵盖监督微调(SFT)和基于 GRPO 的强化学习。开发者只需在单个 Markdown 文档中设定边界条件与评估指标,AI Agent 便能自主修改训练脚本、发起实验,并将验证有效的超参数优化自动提交至 Git。该项目基于 Google 的 Tunix、Gemma 和 Cloud TPU 技术栈构建,消除了繁琐的人工微调过程,已在函数调用与数学推理任务中验证了无人工干预的性能提升。

阅读原文 ↗推荐理由:实现了涵盖 SFT 与 GRPO 强化学习的自主后训练闭环,展示了 AI Agent 自动调优模型的工程落地潜力。# 微调# 芯片# 强化学习# 工作流# Gemma
9月24日2026-09-24
IT之家 · AI 筛选✦ 精选AI 评分 78/10022:02

谷歌启动“捕日计划”:将发射首颗试验卫星探索太空AI数据中心

谷歌计划于10月1日发射名为MVP的实验卫星,作为其“捕日计划”的前期验证。该卫星搭载4枚TPU芯片,算力相当于一台普通服务器,由约1kW的太阳能面板供电,能在太空中直接处理并回答简单的AI查询。此项试验旨在检验计算硬件抵御太空辐射等严苛环境的能力,探索利用太空太阳能运行算力设施的可行性,为未来缓解地面数据中心面临的能耗与空间限制积累技术经验。

阅读原文 ↗推荐理由:谷歌率先推进轨道算力实验,展现了应对地面能耗瓶颈、探索太空AI基础设施的前沿尝试。# Google# 太空数据中心# 芯片# 算力# 捕日计划
arXiv 人工智能✦ 精选AI 评分 75/10012:00

XLOG:面向神经符号集成的 CUDA 原生逻辑编程引擎

论文提出了用于神经符号集成的 CUDA 原生逻辑编程引擎 xlog。该引擎通过类型化前端与 CUDA 运行时,将神经感知与确定性 Datalog、概率推理及认知世界观相结合。各推理模式共享 GPU 设备数据平面,其中常驻递归与蒙特卡洛采样核心在特定推理阶段实现了零主机-设备数据传输开销。此外,其概率推理路径支持通过 GPU 知识编译完成端到端梯度计算,显著提升了神经符号推理的硬件执行效率。

阅读原文 ↗推荐理由:提出了一种面向神经符号推理的 CUDA 原生逻辑编程引擎,在 GPU 层面优化了符号逻辑与深度学习的集成效率。# 神经符号系统# 芯片# 概率推理# GPU加速
InfoQ · 架构与云计算AI 评分 58/10005:57

4096张卡如何成为“一台计算机”?解析华为超节点布局

该内容探讨华为在AI算力基础设施领域的超节点技术布局,重点关注如何通过先进的互联与系统架构,将4096张计算卡高效协同、聚合成具备统一计算能力的“单台计算机”形态,以满足大模型时代的超大规模并行训练需求。由于提供的原文摘要信息不足,关于具体的互联协议、拓扑结构及软件栈支持等详细技术细节有待进一步查阅。

阅读原文 ↗推荐理由:聚焦华为在万卡级/千卡级超节点集群互联架构上的工程探索,对国产算力基础设施演进具有参考价值。# 华为# 超节点# 算力# 集群互联# 芯片
vLLM 官方博客(网页)✦ 精选AI 评分 75/10000:00

vLLM 推出文本水印功能实现方案

开源大模型推理框架 vLLM 介绍了其内置的文本水印实现方案。该方案采用保持分布特性的 Gumbel-max 文本水印技术,结合高效的 GPU 内核优化与统计学检测方法,并支持推测解码(speculative decoding)等高级推理加速特性。通过系统级工程优化,vLLM 在保障模型生成质量与推理吞吐效率的同时,为 AI 生成内容提供了可靠的水印嵌入与溯源能力。

阅读原文 ↗推荐理由:主流推理框架 vLLM 实现了兼顾推理性能与生成质量的原生文本水印方案,对大模型工程落地与内容合规具有参考价值。# vLLM# 文本水印# 大模型# 芯片# 安全
9月23日2026-09-23
Ollama 更新AI 评分 55/10008:53

开源项目发布 v0.34.4-rc0:通过 MLX 算子优化加速 Qwen 3.8 Prompt 处理

在 v0.34.4-rc0 版本更新中,针对 Qwen 3.8 模型的 Prompt 处理性能进行了多项优化。技术方案包括在长序列扫描中采用 MLX 的 gated-delta 核函数,并将 Dense MLP 全局缩放折叠融合至 SwiGLU 结构中,以此降低计算开销并加速提示词处理阶段的推理效率。

阅读原文 ↗推荐理由:展示了基于 MLX 框架对 Qwen 模型的算子融合与长序列处理加速的具体工程实践。# MLX# Qwen# 推理# 芯片# 开源