DCAI
DC AI 热点

全部 AI 动态

9月24日2026-09-24
arXiv 人工智能✦ 精选AI 评分 72/10012:00

MolDesignBench:面向真实场景分子设计任务的LLM智能体评估基准

真实环境下的分子设计对大语言模型智能体提出了极高要求,需要其理解复杂上下文、满足多重约束并进行多步工具推理。针对现有基准偏向狭窄约束和单一路径的问题,研究人员提出了MolDesignBench。该基准紧密贴合实际分子设计场景,可系统评估工具增强型LLM智能体在处理多约束、不可行规范识别及多步工具调用下的综合推理与设计能力。

阅读原文 ↗推荐理由:针对AI4Science与LLM智能体落地场景,构建了更贴近真实复杂分子设计需求的评测基准。# 智能体# 大模型# 分子设计# AI for Science# 评测