平台特色
· 技 术 路 线 ·
📜 古籍 OCR 识别
采用深度学习模型对竖排古籍影印文献进行字符识别,支持异体字、俗字、避讳字等特殊字符的忠实还原,并自动还原竖排版式阅读顺序。
🏷️ 命名实体识别
基于规则与统计相结合的方法,从方志文本中自动识别物产名称、地名、人物、典籍、时间等实体类型,构建结构化的知识要素。
🔗 关系抽取与知识图谱
从文本中提取实体间的语义关系(产地、功效、引用等),构建物产知识图谱,实现知识的可视化呈现与关联查询。
物产浏览
浏览古籍方志中记载的各类物产信息
· 物 产 目 录 ·
知识图谱
实体关系网络可视化 —— 拖拽平移 · 滚轮缩放 · 点击节点查看详情
· 关 系 网 络 ·
💡 拖拽平移 · 滚轮缩放 · 悬停高亮 · 点击节点查看详情
数据统计
平台数据总览与分析
· 数 据 分 析 ·
实体类型统计
关系类型统计
地区物产数量统计
典籍引用次数统计
AI 问答
智能查询古籍方志物产信息
· 智 能 问 答 ·
关于平台
数字人文课程实验项目
· 项 目 介 绍 ·
项目背景
「古籍方志物产知识库」是一个数字人文(Digital Humanities)课程实验项目。项目以古籍方志文献(如《云南通志》等)为数据源,综合运用 OCR 文字识别、自然语言处理、知识图谱等技术,将非结构化的古籍文本转化为结构化的知识资源。
技术栈
HTML5 + CSS3
JavaScript (ES6+)
Canvas 2D 图表
SVG 知识图谱
TextIn OCR
NER 实体识别
关系抽取
pyvis 图谱
数据来源
数据来源于公开古籍方志文献的数字化处理结果,包括但不限于《云南通志》《滇南本草》等明清方志文献。所有数据均经过人工校对与程序化核验。