Java 17 构建的 Pragmatic Chunker:打通 RAG 场景从切片到检索全链路! 一、背景RAG 落地的第一道门槛检索增强生成RAGRetrieval-Augmented Generation已成为企业将私有文档、代码库接入大模型的标配方案。然而开发者落地时需自行拼接“切分 - 向量化 - 入库 - 检索”这条不轻松的流水线每一步都要写脚本、对格式、处理异常中间产物还散落各处、难以复现。针对此痛点基于 Java 17 的开源命令行工具“Pragmatic Chunker”正式发布。它将“切片 - 嵌入向量 - 写入向量库 - 检索验证 - 供 AI Agent 检索”的完整链路收敛到一个可执行 JAR 中每一步都产出可独立理解、自包含、可复现的中间文件。二、它是什么Pragmatic Chunker 是面向 RAG 场景的命令行工具能把 Markdown 与 Java 源码按语义结构切分成信息密度充分、可独立理解的文本块chunk并串联起从切片到检索的完整流水线源文件 (.md / .java)│ chunk 文件切片语义 chunk 化▼*.chunks.json 切片中间文件chunk 原文 元数据│ embed 嵌入向量生成▼*.embeddings.json 向量中间文件向量 原文 完整元数据自包含│ push 推送到向量库▼Qdrant 集合 向量数据入库Point 向量 payload│ search / mcp▼检索验证 / AI AgentRAG 检索环节三、核心特性能力说明✂️ 语义切片Markdown 按标题层级 原子块代码块/表格/列表切分Java 按类 / 方法 / 逻辑块切分 嵌入向量支持本地 Ollama 与 OpenAI含兼容协议服务批次重试、连通性预检 向量入库首期支持 Qdrant按 source_file 先删后加重复推送幂等 检索验证单条查询快速验证检索效果输出 text / raw / payload 三种格式 MCP Server以 mcp 子命令启动向 AI Agent 暴露只读检索工具stdio / HTTP 双传输 可扩展FileChunker / EmbeddingProvider / VectorStore 三套 SPI新增类型/提供方零侵入四、两种使用方式Pragmatic Chunker 既照顾新手上手体验也兼顾工程化批量集成**交互式向导**不带参数启动按欢迎页提示逐步选择能力与配置零学习成本即可跑通流程。**CLI 子命令**chunk / embed / push / search / mcp适合脚本集成与批量处理。五、快速上手一个最小可用的完整流水线本地 Ollama Qdrant 已启动# 1. 切片把 docs 目录下的 Markdown 切成 chunkjava -jar pragmatic-chunker.jar chunk -i ./docs/ -o ./output --type markdown# 2. 嵌入把切片结果向量化默认 Ollama / nomic-embed-textjava -jar pragmatic-chunker.jar embed -i ./output/markdown -o ./embeddings# 3. 推送把向量写入 Qdrant 集合java -jar pragmatic-chunker.jar push -i ./embeddings --collection my_docs# 4. 检索验证java -jar pragmatic-chunker.jar search -q 切片的最大长度如何配置六、技术亮点**语义感知的切片策略**Markdown 按标题层级与原子块代码块、表格、列表切分Java 借助 JavaParser AST 按类 / 方法 / 逻辑块切分并支持 import、Javadoc、字段声明等上下文携带保证每个 chunk 信息自洽。**自包含、可复现的中间产物***.chunks.json 与 *.embeddings.json 既包含原文也包含完整元数据可单独查看、调试与复用链路任意一段出错都能从断点续跑。**幂等入库**对同一 source_file 重复推送采用“先删后加”同一 chunk 使用确定性 UUID v5upsert 幂等集合状态始终与最新中间文件一致。**开箱即用的 MCP 接入**以 mcp 子命令启动 MCP Server向 Qoder、Claude Desktop 等 AI Agent 暴露 search_vector_store、list_collections、list_sources 三个只读检索工具支持 stdio 与 HTTP 双传输并可配置 Bearer Token 鉴权。七、技术栈与运行环境项目要求JDK17 及以上构建工具Maven 3.6仅编译打包时需要操作系统macOS / Linux / Windows可选外部服务本地嵌入用 Ollama云端嵌入用 OpenAI或兼容协议服务向量库首期支持 Qdrant。八、开源与获取Pragmatic Chunker 基于 Apache License 2.0 开源协议发布。开发者可通过 mvn clean package 一键构建出可执行 fat JAR开箱即跑。项目仓库https://gitee.com/wizard-lee/pragmatic-chunker许可证Apache License 2.0欢迎对 RAG 工程化、文档/代码检索感兴趣的开发者试用、提 Issue 与 PR一起把这条“切片到检索”的链路打磨得更顺滑。

相关新闻

最新新闻

VirtualApp:Android应用多开的 5 个常见场景与上手路径

VirtualApp:Android应用多开的 5 个常见场景与上手路径

VirtualApp:Android应用多开的 5 个常见场景与上手路径 【免费下载链接】VirtualApp Virtual Engine for Android(Support 14.0 in business version) 项目地址: https://gitcode.com/GitHub_Trending/vi/VirtualApp VirtualApp(简称 VA&#xff…

2026/8/24 2:17:20
GGUF与MLX格式深度解析:如何为本地大模型部署选择最优方案

GGUF与MLX格式深度解析:如何为本地大模型部署选择最优方案

最近在折腾本地大模型的朋友,可能都绕不开一个选择:LM Studio。它确实把“一键启动”这件事做得足够简单,但当你真的想把一个像千问3.8 27B这样的模型跑起来,并且想长期、稳定地使用它时,会发现“一键启动”只是故事的…

2026/8/24 2:17:20
把一堆图标合并成一张图:spritesmith 的完整上手路径

把一堆图标合并成一张图:spritesmith 的完整上手路径

把一堆图标合并成一张图:spritesmith 的完整上手路径 【免费下载链接】spritesmith Utility that takes sprites and converts them into a stylesheet and its coordinates 项目地址: https://gitcode.com/gh_mirrors/sp/spritesmith 管理后台有 137 个小图…

2026/8/24 2:17:20
2026大模型面试宝典:核心技术与工程实践全解析

2026大模型面试宝典:核心技术与工程实践全解析

1. 为什么大模型面试宝典成为程序员刚需?2026年的大模型技术已经渗透到互联网行业的每个毛细血管。根据头部招聘平台数据显示,掌握大模型相关技能的程序员平均薪资比普通开发者高出47%。这份《大模型面试宝典(2026版)》正是基于当前最前沿的200企业真实面…

2026/8/24 2:17:20
6G显存显卡运行ComfyUI生成4K AI视频:工作流搭建与优化指南

6G显存显卡运行ComfyUI生成4K AI视频:工作流搭建与优化指南

1. 先搞清楚“低端6G显卡跑4K AI视频”到底能做什么,不能做什么如果你手头有一张显存不大的显卡,比如6GB的GTX 1060、RTX 2060,或者更老的型号,看到“4K AI视频生成”这个标题,第一反应可能是怀疑。这很正常。我实测下…

2026/8/24 2:17:20
云原生弹性伸缩新范式:基于负载波动性驱动的自适应优化实践

云原生弹性伸缩新范式:基于负载波动性驱动的自适应优化实践

如果你在云上部署过应用,大概率遇到过这样的场景:明明配置了弹性伸缩,但流量高峰时响应依然变慢;或者,为了应对突发流量,不得不长期预留大量冗余资源,导致成本居高不下。问题出在哪里&#xff1…

2026/8/24 2:12:20