跳到主要内容

解析结果统计与异步收尾

上一篇讲完了 structureNodeExtractor.extract() 的四阶段流水线。现在回到 TikaDocumentParserService.parse() 方法,继续按执行顺序往下走:拿到结构节点之后,还要做标题计数、段落切分、token 估算、结构等级评估和内容质量评估,最后把所有结果打包返回。

然后再回到 handleParseRoute,看解析完成后的收尾工作。

回到 parse():结构节点之后的统计步骤

回顾一下 parse() 方法中,structureNodeExtractor.extract() 之后的代码:

// 结构节点由专门的提取器负责抽取,这些节点后面会参与导航和切块策略判断。
List<DocumentStructureNodeCandidate> structureNodes = structureNodeExtractor.extract(originalFileName, cleanedText);
int headingCount = countHeadings(cleanedText, structureNodes);

// 段落统计既用于结构判断,也用于后续策略推荐时判断是否适合语义切块。
List<String> paragraphList = extractParagraphs(cleanedText);

int maxParagraphLength = paragraphList.stream().mapToInt(String::length).max().orElse(0);

int charCount = cleanedText.length();

// token 数这里是估算值,不是精确 tokenizer 结果,但足够用于策略判断和粗粒度统计。
int tokenCount = estimateTokenCount(cleanedText);

int structureLevel = evaluateStructureLevel(headingCount, paragraphList.size());

int contentQualityLevel = evaluateContentQuality(cleanedText, charCount);

return new DocumentAnalysisResult(
cleanedText,
charCount,
tokenCount,
structureLevel,
contentQualityLevel,
headingCount,
paragraphList.size(),
maxParagraphLength,
structureNodes
);

我们逐个展开。

countHeadings:标题数量统计

/**
* 统计标题数量。
* <p>
* 如果结构提取器已经抽到了较可靠的 section 节点,则优先使用结构化结果;
* 否则退回到逐行分类的启发式标题识别。
* </p>
*/
private int countHeadings(String text,
List<DocumentStructureNodeCandidate> structureNodes) {
if (structureNodes != null && !structureNodes.isEmpty()) {
long structuredHeadingCount = structureNodes.stream()
.filter(node -> node != null
&& DocumentStructureNodeTypeEnum.SECTION.getCode().equals(node.getNodeType())
&& node.getDepth() != null
&& node.getDepth() > 0)
.count();
if (structuredHeadingCount > 0) {
return (int) structuredHeadingCount;
}
}
int count = 0;
for (String line : text.split("\n")) {
if (documentLineClassifier.classify(line).isHeading()) {
count++;
}
}
return count;
}

标题计数有两条路径:

  1. 如果结构节点提取器已经识别出了 SECTION 类型的节点(depth > 0),直接用结构化结果,这个更准
  2. 如果结构节点没抽到,就退化成逐行扫描,用 DocumentLineClassifier 做启发式标题识别

退化路径里用到的 DocumentLineClassifier 是一个轻量级行分类器,它的 classify() 方法会根据当前行的文本形态给出 HEADING / LIST_ITEM / BODY 三种分类。具体的正则匹配规则包括 Markdown 标题(# xxx)、多级数字编号(1.2 xxx)、中文章节(第一章 xxx)、中文大纲(一、xxx)等模式。对于单级编号和中文大纲这种有歧义的模式,它还会通过 looksLikeHeadingContent() 做一层启发式判断——如果内容太长(> 24 字符)、包含句中标点(逗号、分号、冒号)、或者以句末标点结尾,就不认为是标题。

付费内容提示

该文档的全部内容仅对「码力全开」项目实战&技术讲解 知识星球用户开放

加入星球,一次获得完整项目资料、全栈技术知识库和长期答疑服务。

100万+字全栈技术知识库深入讲解技术核心、数据库、中间件和分布式等内容
8套热门的实战项目持续更新的企业级项目覆盖高并发、微服务、数据中台 和 AI Agent 等方向
AI 技术知识大模型面试详解覆盖 AI 模型原理、Agent、RAG、MCP、Skills、Harness 等核心知识点
文档 + 视频两种讲解形式既能系统阅读,也能跟随视频理解核心业务

完整项目实战资料

每套项目均包含从 0 到 1 讲解文档核心业务讲解视频

从基础项目到复杂业务场景,项目资料会持续更新。

8 套项目
  • 01Nexus Agent AI 智能体
  • 02Nexus Agent Pro 完全版
  • 03黑马点评Plus
  • 04大麦
  • 05大麦Pro
  • 06大麦AI
  • 07流量切换
  • 08数据中台

加入后还能获得

进入星球后,即可享受上述所有服务,保证不会再有其他隐藏费用。

从学习、面试到项目启动,都可以继续获得支持。

  • 1 对 1 解答项目和技术问题都可以提问
  • 针对性补充没有讲清楚的内容会继续补充
  • 面试与简历指导梳理回答技巧和项目亮点
  • 中间件云环境项目依赖可以直接接入使用
  • 面试后复盘被问住的问题可以继续交流
  • 远程问题解决项目启动问题可协助排查
知识星球二维码

扫码进入知识星球

  1. 打开微信,扫描左侧二维码,加入「码力全开」项目实战&技术讲解 知识星球
  2. 查看星球使用指导,获取完整项目讲解资料索引
解锁全部付费内容
🎁优惠