谷歌首个 Suncatcher 轨道数据中心测试将于 10 月 1 日发射
谷歌计划于 10 月 1 日启动其名为“Suncatcher”的首个轨道数据中心实验测试。据介绍,该实验性太空数据中心将配备四颗谷歌自研 TPU(张量处理单元),受限于当前环境与能源等条件,系统单次仅运行 15 分钟。该项目旨在探索将 AI 计算硬件部署至太空轨道的可行性,为未来在极端环境下构建和运行算力基础设施积累关键测试数据。
谷歌计划于 10 月 1 日启动其名为“Suncatcher”的首个轨道数据中心实验测试。据介绍,该实验性太空数据中心将配备四颗谷歌自研 TPU(张量处理单元),受限于当前环境与能源等条件,系统单次仅运行 15 分钟。该项目旨在探索将 AI 计算硬件部署至太空轨道的可行性,为未来在极端环境下构建和运行算力基础设施积累关键测试数据。
Google Colab 正式整合进 Google AI 订阅方案中。订阅用户现可直接解锁 Colab 的高级计算资源,获得优先使用的计算加速器、高端 GPU 以及支持长时间模型训练的后台执行功能。该调整进一步打通了 Google 的 AI 订阅权益与开发工具链,方便开发者与研究人员更高效地开展深度学习与模型训练工作。
据外媒报道,甲骨文(Oracle)已针对其位于美国新墨西哥州的AI数据中心项目援引了“不可抗力”(force majeure)条款。目前所提供的原始信息较为有限,尚未透露触发该条款的具体原因、工程受影响的具体阶段,以及对甲骨文算力扩张计划的后续影响,需关注后续详细披露。
Potluck 是一款旨在降低大模型硬件门槛的分布式计算工具。针对个人开发者难以承担高昂 GPU 集群或云算力成本的问题,该项目允许用户将手头的多台普通设备(如笔记本电脑、游戏台式机等)组网连接,协同聚合算力以运行更大参数的本地模型。目前可用于家庭或办公室内的多设备互联,未来目标是构建一个由用户自有设备组成的分布式网络,实现相互共享算力支持大模型推理。
据报道,甲骨文(Oracle)在经历一系列挫折后,已就其大型“木星计划”(Project Jupiter)数据中心园区向投资管理公司 Blue Owl 发出不可抗力通知。该数据中心园区规划位于美国新墨西哥州,容量高达 2.5GW,原定于 2028 年上线投运。此次不可抗力通知的发出,反映出该超大规模算力基础设施在建设与推进过程中正面临重大阻碍。
该论文探讨了一种面向未来的天基(太空)高可扩展人工智能基础设施的系统架构设计。随着地面算力中心在能源消耗、散热极限和物理空间方面面临日益严峻的挑战,构建太空AI基础设施成为解决算力瓶颈的前瞻性探索方向。由于输入素材仅提供了论文标题与arXiv链接,未披露具体的系统拓扑、通信机制及实验评估等细节,完整技术方案需进一步查阅原文。
随着AI算力基础设施的迅猛发展,高密度计算负载对电力供应的可靠性与稳定性提出了前所未有的严苛要求。传统数据中心的备用电力保障体系正面临重塑,促使行业重新思考备份电源策略。为了支撑现代AI计算集群的高功耗与突发电力需求,不间断电源(UPS)及其电池技术必须在能量密度、放电性能和安全性等方面加速演进与升级。
高塔半导体(Tower Semiconductor)计划在日本建立大型光芯片中心,该项目是其40亿美元在日投资承诺的一部分。公司首席执行官近日披露了今年早些时候宣布的业务扩张计划的更多具体细节。该举措旨在进一步扩大其光子芯片的制造产能与战略布局。素材中目前仅透露了扩张计划的框架,详细技术指标与具体建设时间表尚待进一步披露。
据《纽约时报》报道,谷歌准备于下周发射一颗搭载其自研AI处理器的卫星,以测试相关芯片在太空极端环境下的运行表现。该行动隶属于谷歌的实验性计划“捕日者项目”(Project Suncatcher),其长远目标是探索未来将AI数据中心部署到地球轨道的可行性。本次发射的卫星将配备谷歌自研的Tensor系列处理器进行在轨测试。
量子计算公司 QuEra 宣布与慧与科技(HPE)达成合作,将其量子计算机集成到基于 Cray 的高性能计算(HPC)环境中。通过此次合作,QuEra 将通过本地部署和云端两种模式向用户开放其量子计算系统,旨在促进前沿量子计算与经典超级算力基础设施的深度协同与混合应用。
能源基础设施公司 Woodway 计划在美国铺设一条全长 22 英里的天然气管道,专门用于为一个未公开客户的数据中心提供能源支持。该项目将采用“表后”(behind-the-meter)模式直接为数据中心现场发电设施供气,以规避公共电网容量不足并满足高算力场景的电力需求。目前关于该数据中心的具体运营商和选址等详细信息尚未对外披露。
芯片初创公司 SiPearl 宣布已完成首笔 Rhea1 处理器订单,并向 Bull 交付了首批样品。该处理器专为高性能计算场景设计,将部署于欧洲首台百亿亿次(Exascale)超级计算机 Jupiter。本次交付标志着该欧洲自主超算芯片项目取得关键进展。由于输入信息有限,关于本次交付的样品具体规格、测试进度及后续量产交付时间表等细节仍有待官方进一步披露。
CNCF 宣布“可观测性日”(Observability Day)将于 2026 年 11 月 9 日在犹他州盐湖城举行的 KubeCon + CloudNativeCon 北美峰会上回归。该活动旨在聚集来自 CNCF 可观测性社区的项目维护者、运维工程师和终端用户,共同探讨云原生可观测性技术的发展演进、实践应用及行业前沿趋势。
澳大利亚维多利亚州提议出台针对数据中心的新监管规则,要求数据中心运营商必须自行确保其可再生能源的供应。此外,该提案还包含多项配套条款,旨在防止数据中心将高昂的用能与基础设施成本转嫁给普通用户,并严格限制数据中心冷却过程中的过度水资源消耗。这一举措反映了地方政府在应对算力中心扩张对电网及环境造成压力时的监管收紧趋势。
全球数据中心运营商 Digital Realty 宣布聘请前微软资深人士吉姆·柯林斯(Jim Collins)担任其新的全球能源主管。柯林斯将加入该团队负责能源相关业务。由于目前公开提供的素材信息较为有限,关于其具体职责范围、未来能源战略规划以及任命生效时间等详细内容尚未公布。
文章探讨了数据中心冷却系统在选材决策中的关键考量,重点分析了摆脱“大宗商品化思维”的重要性。内容围绕如何为数据中心冷却选择合适的PG25(丙二醇冷却液等介质)展开,指出若将冷却液仅视作无差别的通用耗材,可能忽视品质与适配性差异,从而在后续的系统运维中引发能效下降或故障风险,带来不可预见的长期隐性成本。
三星宣布将作为独家 AI 网络提供商,携手韩国电信运营商 KT 和 SK 电讯展开深度合作。该合作将重点推进 AI-RAN(无线接入网)与 5G 独立组网(SA)技术的落地应用,旨在为韩国在 2030 年代确立 6G 通信和具身智能(Physical AI)领域的先发优势与立足点提供技术保障,为机器人产业筑牢下一代通信网络基础设施底座。
本项目介绍了 Virtio-nvgpu 技术方案,旨在 KVM 虚拟化环境中为 Guest 虚拟机提供接近原生性能的 Nvidia GPU 访问与加速能力。该方案基于 Virtio 框架进行优化设计,致力于减少 GPU 虚拟化过程中的性能损耗,提高云环境及虚拟化集群中的 GPU 算力利用效率。素材提供的具体技术架构与性能基准测试细节有限,实际落地效果仍需进一步工程验证。
该文探讨了光学频率梳发生器在 AI 数据中心的应用价值。随着 AI 数据中心向单纤 16 个以上波长的规格扩展,传统方案需要为每个信道配置独立激光器,而光频梳技术能够利用单个激光器生成多个波长。这种方法大幅削减了硬件能耗、部署成本并减少了潜在故障点,为支撑大规模 AI 基础设施的高密度光互连提供了更高效的物理层解决方案。
文章探讨了向800V直流(800 VDC)架构过渡对AI数据中心基础设施带来的深远影响。随着大规模AI算力集群功耗的急剧增长,传统供电模式面临瓶颈。该架构重点聚焦于提升AI数据中心的能源利用效率、增强系统运行韧性,并对储能系统的整合以及电力分配方式带来了新的技术考量与变革方案。
为应对快速增长的算力需求,华为正式推出了一套全新的计算架构。该架构采用UnifiedBus互连技术,专门用于支持SuperPoD与大规模算力集群之间的高效互连。该设计旨在突破计算节点间的连接瓶颈,优化集群整体性能与扩展能力,为大规模AI训练及高性能计算基础设施提供更强的底层算力支持。
随着数据中心开始采用更多样化的发电与电力供应技术,相关设备的运输、仓储和安装等物流流程正变得愈发复杂。报道指出,伴随计算能耗剧增,新型供电解决方案的引入虽然缓解了能源压力,但也对数据中心上下游的供应链物流管理提出了更高要求,部署重型及特种电力设备已成为基础设施建设中的关键考验。
现代信息检索系统通常同时结合嵌入模型与生成模型处理复杂查询,但现有系统往往将二者隔离部署,粗粒度分配硬件易引发计算气泡,导致 GPU 利用率低和吞吐不足。为此,研究团队提出服务系统 Orthrus。该系统在统一推理循环中引入异构批处理机制,旨在有效整合具有资源冲突特性的嵌入与生成工作负载,提升动态查询下的硬件利用效率。(注:素材摘要文末存在截断)
该内容探讨了大型能源消耗主体如何更好地为能源系统及其服务的社区做出贡献。澳大利亚为此出台了相关数据中心指导准则,旨在推动数据中心等高耗能设施成为电网的“良好公民”,探索其在支撑能源系统稳定与可持续发展方面的协作平台与基础。(注:素材信息有限,主要呈现了准则的愿景与探讨方向)
水资源正从数据中心的后台配套公用设施转变为核心瓶颈制约。随着行业发展,数据中心建设不能仅依赖平均效率指标,而需根据具体场地开展韧性规划,重点考量峰值用水压力、当地水文状况以及对周边社区的影响,以应对日益严峻的现实资源挑战。
在实际运行AI工作负载前,即便GPU集群通过了各项常规健康检查(如GPU单卡、网络链路及Pod状态均显示正常),512卡等大规模分布式训练任务仍可能面临运行失败。文章指出传统的基础硬件监控无法完全保障复杂AI任务的稳定运行,强调了在正式上线AI负载前,必须对GPU集群进行深度的端到端就绪性验证,以提前排查潜在隐患。
Kubernetes 主要负责调度和管理节点上运行的工作负载,但对节点底层的运维管理仍具挑战。NodeWright 旨在解决节点自身的管理难题,涵盖内核参数调优、系统软件包安装与更新、存储布局配置以及安全代理部署等底层系统级运维需求,帮助运维团队更高效地管理 Kubernetes 节点集群基础设施。
该动态宣布为面向个人AI的私有AI计算(Private AI Compute)引入安全的服务器端内存技术。由于目前提供的发布信息较为简短,文章主要聚焦于在云端服务器环境中强化内存隐私与数据安全,旨在兼顾大规模算力扩展与个人AI数据的机密性。具体技术细节及完整实现方案尚需进一步披露。
该文章对比了集中式AI、分布式AI与边缘AI三种计算与部署架构的核心差异。分析指出,企业与开发者在构建AI系统时,应综合权衡低延迟要求、计算与网络成本以及数据合规性等多重因素,从而选择最匹配业务场景的AI基础设施架构方案。
开源项目在 v0.30.1rc0 版本更新中,针对 AMD ROCm 持续集成(CI)流程添加了下一代加速卡 MI355 的 Dense NVFP4 精度及 MoRI 算子内核镜像。该更新由 AMD 工程师提交,旨在完善对 AMD 新一代硬件低精度计算格式的持续集成测试与底层算子支持,加速相关 AI 框架对 MI355 算力生态的适配。