Skip to content

Repository files navigation

BBDC PDF Parser

一个纯前端小工具,用于解析不背单词导出的PDF,并将内容导出为 txt

当前仅支持不背单词导出的默认 PDF 版式:A4默写

导出格式支持两种:

  • 仅导出单词
  • 导出 单词----释义

免责声明

  • 本项目为独立的非官方工具,与“不背单词”及其开发者无关联、无合作、无背书关系。
  • 本项目仅用于处理用户自行合法导出的 PDF 文件,不提供账号登录、数据抓取、词库下载或绕过平台限制的能力。
  • PDF 文件中的词汇、释义、例句及其他内容版权归其原始权利人所有,使用者应自行确保其使用方式合法合规。

功能特点

  • 纯前端处理,不上传文件到服务器
  • 基于 pdfjs-dist 直接读取 PDF 文本层,不做 OCR
  • 自动处理多行释义归并
  • 自动处理部分 PDF 异体部件字形清洗
  • 支持浏览器内预览与 txt 下载

本地运行

要求:

  • Node.js 20+
  • pnpm 10+

安装依赖:

pnpm install

启动开发环境:

pnpm dev

构建生产版本:

pnpm build

本地预览构建产物:

pnpm preview

使用方式

  1. 打开页面并选择 PDF 文件
  2. 点击“开始解析”
  3. 选择是否“包含释义”
  4. 预览结果
  5. 点击“导出 TXT”

项目结构

.
├── index.html
├── package.json
├── src
│   ├── main.js
│   ├── pdf-extractor.js
│   └── style.css

说明:

  • src/main.js:页面交互、状态管理、导出逻辑
  • src/pdf-extractor.js:PDF 文本提取与词条归并逻辑
  • src/style.css:界面样式

技术栈

  • Vite
  • pdfjs-dist
  • 原生 JavaScript / CSS

开源许可

本项目基于 MIT 协议开源。

About

一个纯前端小工具,用于解析不背单词导出的PDF,并将内容导出为 txt。

Resources

Stars

1 star

Watchers

0 watching

Forks

Contributors

Languages