评估代码智能体内核漏洞利用能力:安全评测基准 KEX-bench 发布
尽管代码智能体现已能在生产软件中发现实际漏洞,但漏洞挖掘成果并不等同于构建漏洞利用原语的能力。为此,研究团队推出了用于评估代码智能体针对真实操作系统内核生成利用原语的基准 KEX-bench。该基准涵盖 40 个 Linux 与 Windows 真实 CVE 的 45 个任务实例,涉及内核地址泄露、指令指针控制和任意地址读写等场景,并在隔离虚拟机环境中借助确定性验证器评估智能体的利用能力。
尽管代码智能体现已能在生产软件中发现实际漏洞,但漏洞挖掘成果并不等同于构建漏洞利用原语的能力。为此,研究团队推出了用于评估代码智能体针对真实操作系统内核生成利用原语的基准 KEX-bench。该基准涵盖 40 个 Linux 与 Windows 真实 CVE 的 45 个任务实例,涉及内核地址泄露、指令指针控制和任意地址读写等场景,并在隔离虚拟机环境中借助确定性验证器评估智能体的利用能力。