一文读懂HPD-Parsing架构:InternVL3.5-1B backbone与P-MTP预测技术深度解析 一文读懂HPD-Parsing架构InternVL3.5-1B backbone与P-MTP预测技术深度解析【免费下载链接】HPD-Parsing项目地址: https://ai.gitcode.com/paddlepaddle/HPD-ParsingHPD-Parsing是由飞桨PaddlePaddle开发的轻量级1B参数高吞吐量文档解析模型基于分层并行解码Hierarchical Parallel Decoding范式构建。该模型以InternVL3.5-1B为基础骨干网络创新性地引入了P-MTPProgressive Multi-Token Prediction预测技术在保持解析精度的同时实现了吞吐量的显著提升。HPD-Parsing核心技术架构解析InternVL3.5-1B骨干网络的优势HPD-Parsing采用OpenGVLab/InternVL3_5-1B作为基础模型通过动态分块裁剪技术最多24个448×448大小的图像块保留文档的高分辨率细节。这种架构选择使得模型在处理复杂文档布局时能够兼顾全局结构感知与局部内容理解为后续的分层并行解码奠定了基础。革命性的分层并行解码机制HPD-Parsing的核心创新在于其分层并行解码HPD范式该机制将传统的整页自回归生成重构为全局协调、局部并行的解码过程主布局分支负责全局结构协调动态将单一解码轨迹分解为多个并发的内容分支内容分支每个分支负责特定文档区域的局部内容生成共享前缀KV缓存复用显著缩短分支和 token 维度上的有效顺序解码路径这种架构设计基于文档解析的关键特性页面结构需要全局协调而内容生成则主要在各个区域内局部进行。P-MTP预测技术工作原理Progressive Multi-Token Prediction (P-MTP)是HPD-Parsing中另一项关键技术它通过在每个解码步骤预测多个未来token来减少解码步骤单块预测头设计在modeling_internvl_chat.py中实现了专门的P-MTP头结构推测性解码当启用use_mtp参数时P-MTP头会在每步草稿生成k个token权重加载机制通过load_mtp_weights()方法加载P-MTP权重支持从主检查点或独立的P-MTP目录加载P-MTP技术与分层并行解码相结合使得HPD-Parsing在处理长文档时能显著减少解码步骤在最长输出长度区间可实现高达18.04倍的解码步骤减少。HPD-Parsing性能表现与优势行业领先的吞吐量指标HPD-Parsing在OmniDocBench v1.6上实现了4,752 Tokens Per Second (TPS)的峰值吞吐量相比现有最快的文档解析模型提升1.62倍较其自回归基线提升3.06倍以上。在NVIDIA A800 80GB显卡上批处理大小为512时页面处理速度PPS从1.02提升至2.682.62倍提升令牌吞吐量TPS从1,554.8提升至4,752.13.06倍提升出色的解析精度尽管专注于提升吞吐量HPD-Parsing仍保持了竞争力的解析精度在OmniDocBench v1.6上总体达到94.91%的准确率成为端到端统一解析器中的新标杆。实际应用与部署指南模型加载与使用HPD-Parsing可通过以下方式加载和使用from transformers import AutoModelForCausalLM model AutoModelForCausalLM.from_pretrained(PaddlePaddle/HPD-Parsing) model.load_mtp_weights() # 启用P-MTP推测解码核心生成函数model.generate_hpd(...)实现了分层并行解码逻辑主要参数包括use_mtp是否启用P-MTP推测解码默认Falsenum_speculative_tokens每次推测的token数量默认6评估与基准测试项目提供了完整的评估脚本位于eval/目录下eval/benchmark_tps.py用于复现吞吐量TPS测试结果eval/hpd_to_markdown.py将HPD-Parsing预测结果转换为markdown格式基准测试默认配置使用批处理大小512和P-MTP推测配置num_speculative_tokens6预测结果将保存为batch_512_pred_HPD-Parsing.json。总结重新定义文档解析效率HPD-Parsing通过InternVL3.5-1B骨干网络与P-MTP预测技术的创新结合证明了文档解析可以通过全局布局协调和局部并行解码而非单一顺序生成轨迹来高效执行。其1B参数的轻量级设计、4,752 TPS的高吞吐量和94.91%的解析精度为文档理解与处理领域树立了新的效率标准。无论是企业级文档处理系统还是个人开发者项目HPD-Parsing都提供了一种平衡精度与性能的理想解决方案特别适合处理长文档和大规模文档解析任务。随着后续版本的迭代我们有理由相信这一架构将在更多场景中展现其潜力。要开始使用HPD-Parsing可通过以下命令克隆项目仓库git clone https://gitcode.com/paddlepaddle/HPD-Parsing【免费下载链接】HPD-Parsing项目地址: https://ai.gitcode.com/paddlepaddle/HPD-Parsing创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

最新新闻

ADK Go 2.0多智能体工作流:图编排、人工循环与动态编排实践

ADK Go 2.0多智能体工作流:图编排、人工循环与动态编排实践

最近在尝试把一个单智能体的数据处理流程扩展成多智能体协作时,遇到了一个典型问题:每个智能体都能独立完成任务,但把它们串起来后,要么卡在某个环节等不到响应,要么因为一个节点失败导致整个流程崩溃。这时候我才意识…

2026/7/26 22:33:21
ProxyMan进阶教程:自定义代理规则与忽略主机设置

ProxyMan进阶教程:自定义代理规则与忽略主机设置

ProxyMan进阶教程:自定义代理规则与忽略主机设置 【免费下载链接】ProxyMan Configuring proxy settings made easy. 项目地址: https://gitcode.com/gh_mirrors/pro/ProxyMan ProxyMan是一款强大的代理管理工具,能够帮助用户轻松配置系统级代理设…

2026/7/26 22:33:21
智能体系统架构设计与LangChain集成实战

智能体系统架构设计与LangChain集成实战

1. 智能体技术全景解析在当今AI技术快速发展的背景下,智能体(Agent)系统正成为企业自动化流程和复杂任务处理的核心解决方案。这套技术栈通常包含四个关键组件:基础智能体(Agent)、技能模块(Agent Skills)、中央控制平台(MCP)和工作流引擎(Workflow)&…

2026/7/26 22:33:21
GLM 5.2越狱攻击检测实战:大模型安全防护与红蓝对抗

GLM 5.2越狱攻击检测实战:大模型安全防护与红蓝对抗

这次我们来看一个很有意思的安全测试案例——GLM 5.2 对 GPT-6 的越狱攻击检测。这个事件最近在技术圈引起了不少讨论,核心是 GLM 5.2 作为安全检测工具,成功识别出了 GPT-6 可能存在的越狱攻击风险。对于关注大模型安全、红蓝对抗和实际部署的开发者来说…

2026/7/26 22:33:21
5分钟上手AI Wallpaper Generator:面向设计师的实用教程

5分钟上手AI Wallpaper Generator:面向设计师的实用教程

5分钟上手AI Wallpaper Generator:面向设计师的实用教程 【免费下载链接】aiwallpaper AI Wallpaper Generator 项目地址: https://gitcode.com/gh_mirrors/ai/aiwallpaper AI Wallpaper Generator是一款专为设计师打造的AI壁纸生成工具,能帮助你…

2026/7/26 22:33:21
Agent平台化爆发K3开源:GEO从搜索引用演进为代理推荐

Agent平台化爆发K3开源:GEO从搜索引用演进为代理推荐

引言:2026年7月26日,GEO的“范式切换日”2026年7月26日,AI产业的竞争维度正在发生一次深层切换——从“谁家的模型更强”转向“谁家的Agent更能干活”。OpenAI正式发布企业级智能体平台Presence,宣称75%的客服来电可实现无人化处理…

2026/7/26 22:28:21

月新闻