跳到主要内容
返回文章列表

2026年8月25日 · 阅读 6 分钟

从一本教材到今天的复习卡片:遇词怎么处理一本书

上传之后到能在手机上背诵之间,遇词做了提取、诊断、问卷、分层四步。搞清楚每一步在做什么、为什么需要这一步,能帮你更好地读懂书籍详情页里的每一个状态。

遇词的目标不是给你一份通用词表,而是给你"这一本书"的专属生词本。要做到这件事,从上传到能背诵之间必须经过几个固定步骤,每一步都会体现在书籍详情页的状态里。

第一步:上传与正文提取

支持上传 PDF、EPUB、TXT 三种无 DRM 格式。系统会先提取正文,同时跳过目录、页眉页脚、参考文献列表这类不代表书籍实际内容的噪音——这一步直接影响后面候选词统计的准确性,如果把参考文献里的人名、期刊名也算进词频,三层分类会被严重干扰。

第二步:分词、去重与候选生词提取

正文提取完成后是分词、词形还原(把 upregulated / upregulates / upregulation 这类变形归并到同一个词条)、去重,再用通用词频过滤掉本来就属于基础词汇的部分,同时用 scispaCy 做术语识别,标出专业实体词。这一步结束后得到的是这本书的候选生词集合——注意这时候还没有"层级",只是一份还没排优先级的清单,对应书籍详情页里"正在提取正文、识别术语并生成候选词"的处理中状态。

第三步:诊断测试,校准你真实掌握了多少

候选词提取完成后,系统会按学科词频表的频段分层抽样出 50–100 个词做一次 3–5 分钟的诊断测试,每个词自评"认识会用 / 眼熟但记不住 / 完全不会"三档。测试里会混入少量并不存在的伪词,用来校准自评偏差——很多人会高估自己对生词的掌握程度,伪词校准能让分层结果更贴近真实水平,而不是单纯依赖主观判断。

第四步:需求问卷 + 生成三层词表

诊断之外还有一份简短问卷,了解你的细分方向(药理 / 免疫 / 分子生物…)和目标(应付课程 / 长期打基础 / 备考读研)。诊断结果、问卷信息和候选词的书内频率、学科词频一起进入分层规则引擎,生成核心词、长期积累词、拓展词三层词表(判定逻辑见《核心词、长期积累词、拓展词:三层词表分别解决什么问题》)。这一步对应书籍详情页的"正在根据诊断与学习方向生成三层词表"状态,完成后书籍状态变为已生成。

第五步:浏览、背诵与导出

词表生成后,每个词条会展示中文释义、英文释义和取自原书的短语境例句,帮助你在真实上下文里理解这个词。背诵采用 FSRS 间隔重复算法安排复习节奏,进度会被记录下来;需要的话也可以导出成 CSV 或 Anki .apkg,带去其他工具里继续使用。

返回文章列表