mlxrunner 发布 v0.34.4-rc1:升级 XGrammar 0.2.7 优化结构化输出
mlxrunner 发布了 v0.34.4-rc1 预发布版本。该版本将 XGrammar 依赖项升级至 0.2.7 版本,以改善模型的结构化输出能力。本次更新重点包含针对模式(Schema)的修复,解决了带类型字典值以及短数组在处理过程中的相关问题。原素材为轻量级版本发布说明,提供的具体技术细节相对有限。
mlxrunner 发布了 v0.34.4-rc1 预发布版本。该版本将 XGrammar 依赖项升级至 0.2.7 版本,以改善模型的结构化输出能力。本次更新重点包含针对模式(Schema)的修复,解决了带类型字典值以及短数组在处理过程中的相关问题。原素材为轻量级版本发布说明,提供的具体技术细节相对有限。
微软研究院针对机器人硬件难以跟上AI能力增长的瓶颈,发布了有关“推理卸载”的最新研究成果。研究表明,将AI模型的推理计算任务转移至机器人本体之外的外部计算平台,能够显著提升任务执行的成功率并提高系统效率,同时支持运行更为复杂的先进物理AI工作负载,为智能机器人突破车载硬件限制提供了可行的计算架构方案。
在 v0.34.4-rc0 版本更新中,针对 Qwen 3.8 模型的 Prompt 处理性能进行了多项优化。技术方案包括在长序列扫描中采用 MLX 的 gated-delta 核函数,并将 Dense MLP 全局缩放折叠融合至 SwiGLU 结构中,以此降低计算开销并加速提示词处理阶段的推理效率。
文章盘点了近期密集发布的虚构或前瞻性大模型动态,涵盖Anthropic的Claude Opus 5.5,以及OpenAI的GPT-6 Sol和GPT-6 Luna等。作者指出,新一代模型在定价上掀起更激烈的价格战,其中GPT-6 Sol与Luna的定价仅为其上一代对应版本的一半,在兼顾高性能的同时大幅压低应用开发成本,引发对模型性价比与开发者生态的新一轮讨论。
文章介绍了针对GPT-6优化的提示词缓存(Prompt Caching)技术。该机制通过实现更高的缓存命中率、引入全新诊断工具、显式断点设置以及细粒度控制功能,帮助开发者在调用模型时有效减少推理延迟并降低API使用成本。摘要中未提及更多底层架构细节或具体的性能测试对比数据。
本地模型运行框架 Ollama 发布 v0.34.3 版本更新。新版本在 CLI 和 /api/show 接口中新增了对各模型“思考级别(thinking controls)”参数及其默认值的展示支持;同时支持通过 MLX 在 Apple Silicon 设备上运行 Nemotron H 视觉模型。此外,该版本还修复了从 HuggingFace 拉取模型的问题,并优化了 macOS 客户端的应用激活窗口逻辑。
开源命令行工具与 Python 库 llm 发布 0.36 版本。新版本新增了对 gpt-6-sol 和 gpt-6-luna 模型的支持;模型插件现可声明 supports_conversation = False,用于处理仅支持单轮提示词的模型,并在接收对话历史时主动报错;同时,llm logs 的 Markdown 输出中将推理链跟踪折叠显示,并修复了多项社区贡献的问题。
GPT-6 Sol 与 GPT-6 Luna 模型现已在 Amazon Bedrock 平台正式全面可用(GA)。这两款新模型的引入,旨在帮助开发者和企业用户根据不同业务工作负载的具体需求,更灵活地在智能水平与运行效率之间进行权衡和匹配,从而为日常工作流及各类生产力场景提供更多样化的生成式 AI 模型选择。
本次发布推出了 GPT-6 Sol 和 GPT-6 Luna 两款全新前沿模型。这两款模型旨在将前沿智能能力引入日常工作场景中,并通过在模型能力与使用成本之间提供不同的平衡方案,满足用户在不同业务需求下对高性能与高性价比的差异化诉求。
随着大语言模型(LLM)推理在个人、企业及受监管行业中日益广泛地处理敏感数据和专有模型上下文,隐私与安全防护变得至关重要。英伟达通过其机密计算(Confidential Computing)技术,致力于在保护数据隐私和知识产权的同时,提供生产级的高性能AI推理能力,确保大模型在云端及基础设施中的安全可靠运行。
文章探讨了向量搜索(Vector Search)技术的发展现状。虽然向量搜索正逐渐演进为一种基础数据类型并集成至各类数据库系统中,但其背后的算力消耗、存储开销及整体经济成本(Money Math)依然是企业在实际落地时需要面对的核心挑战。由于输入材料缺乏详细摘要,具体的技术方案与财务分析细节尚不充分。
开发者发布了适用于 LLM CLI 工具的全新插件 llm-typesafe 0.1a0,新增对 TypeSafe AI 旗下 Jev 模型的调用支持。用户通过安装该插件并配置对应 API 密钥后,即可利用 Jev 模型执行结构化判定任务,例如针对文本的是非概率判断(输出置信度得分),以及在预设条件下的多类别选择与意图路由,便于在命令行及自动化工作流中集成类型安全的模型交互。
Amazon SageMaker AI 推出并发扫描功能,帮助用户在不同负载水平下系统性基准测试生成式 AI 端点,以实现算力资源的合理配置(Right-sizing)。文章详细介绍了模型部署流程,以及如何利用 CreateAIBenchmarkJob API 运行自动化并发测试,并根据测试结果在算力集群规模(Fleet Size)和容量规划上做出基于数据的决策。
Tata Elxsi 基于 AWS 构建了实时工业安全平台 IRIS。该平台通过在边缘端对摄像头视频进行过滤,利用 Amazon Kinesis 传输元数据,并在 Amazon SageMaker AI 上运行计算机视觉模型,将检测结果关联为高置信度警报。该系统将不安全工况的检测时间从数分钟缩短至数秒,显著提升了工业现场的安全响应效率。
Parallel 宣布采用 GPT-6 Astra 模型赋能其智能体应用。与先前的模型相比,搭载该模型的智能体在调研和整合劳动力市场数据时,将所需时间缩短了一半,同时计算与调研成本也降低了50%,显著提升了特定场景下的工作效率与经济效益。
The compute and memory demands of generative AI increasingly exceed what a single GPU can provide. NVIDIA TensorRT multi-device inference is a new capability...
xAI's Grok 4.6 is now available in Amazon Bedrock: a frontier model for long-running agents, coding, and knowledge work, with a 500K token context window and four reasoning effort levels. It runs on both the bedrock-mantle and bedrock-runtime endpoints, with Converse API and cross-Region inference support.
过去两年,全球AI产业的关键词是“抢GPU”。从Meta、微软到xAI,动辄十万卡级别的集群建设不断刷新着人们对算力规模的想象。在这一背景下,笔者有幸采访到了Akamai云计算首席技术官Jay Jenkins,围绕AI算力的分配逻辑、推理场景的隐性成本、分布式架构的合规价值以及多智能体时代的基础设施挑战,进行了深入探讨。
随着AI训练与推理集群将单机柜功率从过去的10~30kW迅速推向100kW甚至更高,数据中心供配电架构正面临一场变革。传统交流供电在电流增大、铜缆数量增加、配电空间占用和能效优化等方面日益吃力,800V直流由此被推向舞台中央。
Amazon SageMaker AI shipped 13 inference launches in year-to-date across two deployment paths: fully managed endpoints and Amazon SageMaker HyperPod Inference. This post reviews each launch, from inference recommendations and capacity-aware instance pools to tiered KV caching and disaggregated prefill and decode.
You’re deploying a model on a system. It starts up, prompts are getting responses. Now the hard question: Is this fast? Your instincts might lead you to send...
今日,华为全联接大会2026在上海启幕,华为副董事长、轮值董事长汪涛发表题为“智启新未来,打造智能世界的硅基黑土地”的主题演讲,发布全球首个采用NPO技术的超节点——昇腾960超节点,加速十万亿规模的大模型训练和推理。
System performance, efficient infrastructure scaling and continuous software optimization are key levers that determine AI inference economics. Higher system performance means more tokens generated, resulting in higher revenue. Efficient scaling means throughput grows proportionally as hardware gets added, requiring fewer resources to serve users at scale. Continuous optimization means generating more value from infrastructure investments. […]
Know everything. Do anything. That was the message NVIDIA founder and CEO Jensen Huang brought to Salesforce Dreamforce Tuesday, joining CEO Marc Benioff onstage in an appearance that coincided with the announcement of Koa — Salesforce’s first CRM reasoning model, built on NVIDIA Nemotron 3 Super. Huang didn’t just take the stage. He walked into […]
Algorithms & Theory
Power is a defining constraint for AI factories. As AI workloads demand a full compute platform to serve them, each component of that platform must maximize...
Biomolecular structure prediction is now often run at proteome scale, where the goal is to move an entire worklist through the pipeline efficiently. NVIDIA...
Every enterprise AI strategy eventually runs into the same question: not just which models to use, but where to run them. That question is…
Encode-prefill-decode (EPD) disaggregation is an inference optimization technique for multimodal models that separates the vision encoder stage from the prefill...
A Look at Recurrent Depth, Hidden Chains of Thought, and Recent Research on Looping Transformer Blocks