Think Broad, Act Narrow: CWE Identification with Multi-Agent Large Language Models 一、文章主要内容和创新点1. 主要内容本文针对现有大型语言模型(LLMs)在漏洞检测中存在的局限性,提出了一种基于多智能体LLM的CWE(常见弱点枚举)识别方法。现有技术的核心问题包括:(1)LLMs难以通过一次性预测完成漏洞检测所需的深度分析;(2)多聚焦于函数级分析,缺乏函数外的上下文信息;(3)二进制分类可能导致漏洞被正确识别但关联错误的CWE,误导开发者。为此,本文设计了三步多智能体流程:步骤1(列出候选CWE):由两个智能体协作, exhaustive 搜索待分析函数中潜在的CWE,扩大搜索范围以减少假阴性;步骤2(提取相关上下文):三个智能体识别并提取用于验证候选CWE的外部上下文信息(如代码库中其他部分的相关代码);步骤3(确认CWE):最终智能体基于收集的上下文对每个候选CWE进行推理,确认或拒绝,减少假阳性。评估结果显示:在PrimeVul数据集上,步骤1对40.9%的漏洞函数正确识别了CWE;在10个合成程序上,全流程将假阳性从6-9个减少至1-2个,且10个案例中有9个正确识别了真实CWE。2. 创新点多智能体协作框架:通过分工明确的智能体团队(列出候选、提取上下文、确认结果),克服了单LLM一次性预测的局限性,实现了“先广度搜索,再精准筛选”的逻辑;

相关新闻

最新新闻

Python networkx邻接矩阵可视化:从矩阵构建到布局优化的完整指南

Python networkx邻接矩阵可视化:从矩阵构建到布局优化的完整指南

1. 从邻接矩阵到可视化网络:一个被低估的起点在数据分析和算法研究的路上,我们经常和“图”打交道。无论是社交网络里的好友关系、知识图谱里的概念链接,还是交通网络里的站点连接,本质上都可以抽象成点和边的集合。而邻接矩阵&am…

2026/8/28 8:14:48
大型前端应用的权限边界怎么划

大型前端应用的权限边界怎么划

大型前端应用的权限边界怎么划先区分界面控制与授权 大型前端常用路由守卫或 hasPermission(BTN_EDIT) 控制页面与按钮,这些做法能减少无权用户看到的入口,却不能保护后端资源。浏览器代码和状态都在用户可控制的环境里,直接调用接口、修改请…

2026/8/28 8:14:48
英伟达算力推理芯片

英伟达算力推理芯片

文章目录推理芯片表格对比满血版对华阉割版高带宽存储器总结推理芯片表格对比 表格为Dense(稠密)口径下的比较 满血版 芯片型号架构发布时间显存规格核心算力显存带宽对华出口状态A100Ampere2020年80GB HBM2eFP16: 312 TFLOPS2.0 TB/s禁售H100Hopper2…

2026/8/28 8:14:48
0.13 的差异(约 43% 相对误差)不算正常,属于明显偏大,需要排查原因

0.13 的差异(约 43% 相对误差)不算正常,属于明显偏大,需要排查原因

0.13 的差异(约 43% 相对误差)不算正常,属于明显偏大,需要排查原因。Siemens(T3Ster/Simcenter)结果通常被视为高精度参考,您的计算值偏高较多。 1. 差异是否正常的判断 正常范围:同一器件、同一次测试条件下,重复性好的测量差异通常在 5% 以内(甚至更好可达 2-3%)…

2026/8/28 8:14:48
Wordle变AI擂台:多轮反馈与提示词工程实战

Wordle变AI擂台:多轮反馈与提示词工程实战

把 Wordle 改造成一组小型 AI 挑战,是我最近在练手时觉得性价比很高的方向。Wordle 规则很简单:六次机会,猜一个五字母英文单词,每次猜测会返回绿、黄、灰三种标记。绿代表位置和字母都对,黄代表字母对但位置不对&…

2026/8/28 8:14:48
基于Stigmergy的团队LLM wiki协作机制与FastAPI工程实践

基于Stigmergy的团队LLM wiki协作机制与FastAPI工程实践

Stigmergy 听起来像一个冷门词,但它可能是团队协作型 LLM wiki 最值得借鉴的设计原则。Andrej Karpathy 带动的 “LLM wiki” 讨论,通常指向一种个人化知识管理范式:一个人借助大语言模型持续提问、修订、链接页面,把零散笔记变成…

2026/8/28 8:09:48