一个纯前端小工具,用于解析不背单词导出的PDF,并将内容导出为 txt。
当前仅支持不背单词导出的默认 PDF 版式:A4默写
导出格式支持两种:
- 仅导出单词
- 导出
单词----释义
- 本项目为独立的非官方工具,与“不背单词”及其开发者无关联、无合作、无背书关系。
- 本项目仅用于处理用户自行合法导出的 PDF 文件,不提供账号登录、数据抓取、词库下载或绕过平台限制的能力。
- PDF 文件中的词汇、释义、例句及其他内容版权归其原始权利人所有,使用者应自行确保其使用方式合法合规。
- 纯前端处理,不上传文件到服务器
- 基于
pdfjs-dist直接读取 PDF 文本层,不做 OCR - 自动处理多行释义归并
- 自动处理部分 PDF 异体部件字形清洗
- 支持浏览器内预览与
txt下载
要求:
- Node.js 20+
- pnpm 10+
安装依赖:
pnpm install启动开发环境:
pnpm dev构建生产版本:
pnpm build本地预览构建产物:
pnpm preview- 打开页面并选择 PDF 文件
- 点击“开始解析”
- 选择是否“包含释义”
- 预览结果
- 点击“导出 TXT”
.
├── index.html
├── package.json
├── src
│ ├── main.js
│ ├── pdf-extractor.js
│ └── style.css
说明:
src/main.js:页面交互、状态管理、导出逻辑src/pdf-extractor.js:PDF 文本提取与词条归并逻辑src/style.css:界面样式
- Vite
- pdfjs-dist
- 原生 JavaScript / CSS
本项目基于 MIT 协议开源。