DCAI
DC AI 热点

精选

当前热点完整榜单 →
1Anthropic 与 Akamai 达成 116 亿美元云算力协议,年内算力支出承诺已超 5000 亿美元83 热度 ⌁2马斯克披露AI算力布局:Colossus集群拟部署超百万张英伟达GB300芯片81 热度 ⌁3试图入侵政府与高校网站:OpenAI 智能体4次“失控”行为细节曝光79 热度 ⌁4美国能源部拨款19亿美元支持31个电网升级项目以加速数据中心并网79 热度 ⌁5谷歌支持的Fervo Energy在犹他州Cape Station地热电站实现首次发电77 热度 ⌁
9月25日2026-09-25
arXiv 自然语言处理✦ 精选AI 评分 68/10012:00

大模型自动批卷的成败边界:两门计算机考试的实证研究

一项来自学术界的新研究评估了大语言模型(LLM)用于高校考试自动评分的可靠性与局限。研究团队在包含570名学生的计算机视觉考试上测试了开源与闭源模型的171种配置。结果显示,最优模型的平均绝对误差达到1.64/35,甚至优于两位人类评分员之间2.61/35的分歧水平。然而实验发现模型对提示词极度脆弱:加入一句简短的“严格评分”提示,便导致17个开源模型中的14个评分严重失常,甚至有模型直接停止评分。

阅读原文 ↗推荐理由:通过严谨实证揭示了大模型在主观题阅卷中的高精度潜力与对提示词微调的极端脆弱性。# 大模型# 评测# 自动阅卷# 提示词工程# 计算机教育
arXiv 自然语言处理✦ 精选AI 评分 70/10012:00

大模型评估研究:似然排序在规模扩展表现上不同于提示词方法

该研究探讨了大语言模型(LLM)的评估方法。在多项选择问答任务中,常规基于似然的评分与提示词方法类似均依赖任务上下文。研究团队提出了一种基于问答对构建的陈述句进行似然排序的补充评估协议。通过对95个参数量从1亿到1040亿的仅解码器模型在10个多选题数据集上的测试,系统对比并揭示了似然排序与提示词方法在模型规模扩展表现上的差异。

阅读原文 ↗推荐理由:通过跨越近百个模型的大规模实验,揭示了大语言模型在似然排序与提示词评估方法上的扩展性差异。# 大模型# 评测# Scaling Law# 似然排序# 提示词工程
9月23日2026-09-23
OpenAI 官方动态✦ 精选AI 评分 75/10005:00

GPT-6引入改进版提示词缓存:提升命中率并降低延迟与成本

文章介绍了针对GPT-6优化的提示词缓存(Prompt Caching)技术。该机制通过实现更高的缓存命中率、引入全新诊断工具、显式断点设置以及细粒度控制功能,帮助开发者在调用模型时有效减少推理延迟并降低API使用成本。摘要中未提及更多底层架构细节或具体的性能测试对比数据。

阅读原文 ↗推荐理由:介绍了下一代大模型在提示词缓存与推理成本优化方面的重要工程改进。# 大模型# 推理# 提示词工程# GPT-6
AWS 机器学习✦ 精选AI 评分 68/10001:18

使用 Strands Evals 与 Amazon Bedrock AgentCore 评估智能体技能执行能力

在智能体开发中,技能(Skills)可将特定领域流程编码为可复用的便携指令,但仅凭流畅的回答无法证明智能体选择了正确的技能或严格遵循了指令。本文介绍了如何利用 Strands Evals 与 Amazon Bedrock AgentCore 评测体系,量化衡量智能体在实际任务中的技能选择准确性及指令遵循能力,为构建可靠的智能体应用提供系统化评测方案。

阅读原文 ↗推荐理由:聚焦智能体技能选择与指令遵循的量化评测,对智能体工程化落地与质量验证具有实用参考价值。# 智能体# 评测# Amazon# 提示词工程