LightRead 学术写作中的引用核验机制

学术引用与原始文献核对示意

LightRead 将引用核验纳入 LaTeX 和 Typst 学术写作流程。参考文献需要经过检索与书目信息核对,正文中的引用需要有相应原文支持。对于检索未命中、信息不一致或尚未完成核验的条目,Agent 会继续开展定向复核;经过复核仍无法确认的来源,不得作为已核实引用进入定稿。

一条文献即使与研究主题高度相关,也不能仅凭题名合理、格式完整或模型熟悉就被采纳。LightRead 采用保守的处理原则:允许暂时舍弃缺少可靠证据的候选文献,并通过补充检索、来源替换或正文修订完成后续工作。

讨论 AI 写作的引用风险时,需要考察这些核验步骤是否实际执行,以及它们如何影响最终稿件。证据回溯能够帮助研究者返回来源;来源是否真实、书目信息是否准确、正文是否正确使用了该来源,则需要在写作任务中分别查证。

从参考文献文件开展批量核验

在 LaTeX 和 Typst 项目中,参考文献通常保存在 BibTeX 等结构化文件中,正文通过引用键与条目建立关联。这种组织方式为整稿核验提供了明确对象:既可以逐条核对来源,也可以检查正文实际使用了哪些文献,以及修订后是否存在失效的引用。

仅检查文件语法或编译结果,无法判断其中的文献是否真实。一个条目可以具有完整的作者、期刊和 DOI 字段,并正常出现在参考文献表中,却仍然指向不存在的论文,或将不同论文的信息拼接在一起。因此,LightRead 的核验流程需要把文件中的条目与实际检索结果逐项比对。

批量检索与书目信息比对

系统对参考文献文件开展批量核查,可将相互独立的检索并行处理。每条文献都需要保留对应的核验结果,核对内容包括题名、作者、年份、期刊或会议,以及存在时的 DOI 等标识。批量执行覆盖整份待核验清单,核验结论仍落实到单个条目。

LightRead 会联合比对题名、作者、出版年份、来源刊物与 DOI,核对各字段是否指向同一篇文献及相应版本。系统会结合实际出版记录,检查预印本与正式发表版本之间的题名、作者顺序和出版年份变化,确认当前引用对应的具体版本。

对未通过的条目继续定向检索

初次检索未命中,可能源于条目错误,也可能受数据库覆盖范围、语言或出版版本差异影响。LightRead 会将这类条目,以及存在字段冲突、尚未核验的条目,交由 Agent 进一步检索;需要独立复核时,再将相关材料交给子代理审查。

Agent 会根据已发现的问题开展定向检索。题名不完整时,结合作者和来源刊物定位记录;年份存在分歧时,核对所引版本及发表信息;缺少 DOI 时,利用正式出版记录、学位授予单位或可核对的原始文献继续查证。核验结果会记录确认文献身份的具体依据。

并行检索和子代理的具体安排取决于任务范围、复杂程度与可用预算。尚未执行的必要检查应保留为未完成项,不计入已经核验的结果。

核验结果必须反映到稿件中

确认来源后,Agent 依据可靠记录更正书目信息,并复查受影响的正文引用。发现虚构或错配的文献时,需要删除对应条目;能够取得适当替代来源的,先核实新来源,再修改正文。继续检索仍无法确认的条目,也应排除在定稿之外。

排除一条文献还会影响依赖它的论述。如果相关句子失去了依据,就需要补充其他经核实的证据、收窄表述,或删除该句。仅移除参考文献表中的条目而保留原有结论,不能完成这项修订。

保守处理确实可能暂时排除一篇真实但难以查证的文献。这是该策略需要承担的取舍。核验记录应保留检索范围、未能确认的原因和处置结果;后续取得原始论文或可靠出版记录后,可以重新核查。当前证据不足以采用,与认定文献不存在,是两种不同结论。

独立审查核对正文与原文的支持关系

书目核验确认文献身份,原文复核判断引用是否使用得当。即使全部参考文献真实存在,正文仍可能误述研究结果、遗漏实验条件,或者把相关工作中的转述当作被引论文自身的发现。

LightRead 的学术写作流程因此设置了与起草相分离的引用核验环节。审查以当前正文、引用位置和对应来源为依据,重新判断每项主张是否得到支持。需要独立审查的任务可以由子代理承担对抗式复核,针对来源错配、证据不足、数值变化和过度概括提出具体问题,并指向可检查的原文位置。

以方法比较为例,原文可能只报告某种方法在特定数据集和实验设置下优于对照方法。若综述将其概括为“该方法普遍优于现有方法”,就扩大了原文的适用范围。修订时需要恢复数据集、对照对象及实验条件,而不能仅因论文题名与主题相关就保留这一结论。将观察到的相关性写成因果关系、将作者提出的解释写成已验证机制,也需要按同样原则回到原文处理。

审查意见应说明具体句子的问题、对应证据及建议修改的范围;主代理据此修订后,再复核发生变化的引用与论述。若更换了来源,也必须重新确认新文献能够支持修改后的句子。

原文核验同时要求明确已经读取了哪些材料。不同材料提供的证据范围如下:

已取得的材料 可以开展的核对 对正文写作的约束
题录、正式出版记录 文献是否存在,作者、题名、年份和来源版本是否一致 可确认书目身份,尚不足以撰写实验细节或结果分析
摘要 研究问题、方法概述和摘要明确报告的主要发现 论述限于已读取的内容,不扩展为摘要未提供的细节
原文及相应图表 具体方法、样本量、数值、限定条件,以及结论所依据的证据 精确论述对应具体段落、页码或图表,并保留原文的适用范围

检索确认了来源之后,正文仍需依照实际取得的材料展开;证据不足的部分应继续补充阅读,或调整论述范围。

中文文献与机构数据库的检索条件

中文期刊、学位论文和会议论文的收录情况,可能与国际学术数据库存在差异。缺少 DOI、未被某个数据库收录,均不足以直接否定文献真实性。如果核验只依赖单一数据库,真实文献也可能被遗漏。

LightRead 提供知网(CNKI)、万方等中文学术检索能力,可结合中文题名、作者、来源刊物和学位授予单位继续查证。这些渠道使核验能够使用文献原有的书目信息,尤其适用于中文学位论文、无 DOI 条目,以及国际数据库记录不完整的来源。

对于需要登录或机构订阅的数据库,LightRead 可以在用户具备相应访问权限、浏览器会话和设备可用的条件下,调用对应的检索与读取能力。部分机构资源依赖校园网出口 IP 或 CARSI 等统一身份认证,相关访问需要沿用用户可用的机构环境。系统的连接方式见多设备与机构网络协同说明。

题录检索权限与全文访问权限可能不同。取得出版记录后,可以继续核对文献身份;涉及原文中的具体实验数据或方法细节时,则需要取得对应内容。机构未订购、认证失效或全文暂不可获取,应如实记录其影响。用户提供的可核对原始文献,也可以补充这一阶段所需的证据。

引用风险应结合实际写作流程评价

2024 年发表于 JMIR 的一项研究,在 2023 年使用 ChatGPT 3.5 对 10 个主题生成了 102 条引用。其中 76 条真实存在;按表 2 两组数据合计,66 条引用准确,分别约占总数的 74.5% 和 64.7%。该研究测试了特定模型的引用生成表现,未涉及 LightRead。研究原文

这类研究为引用核查提供了明确依据。评价 LightRead 时,还需要考察检索、定向复核和稿件修订之后的实际结果:错误条目是否被识别和处理,未核实条目是否仍出现在终稿中,以及保留的引用是否准确支持正文。通用模型在既定实验中的错误比例,无法直接代替这一产品层面的评价。

LightRead 将核验结果用于后续写作。Agent 可以针对疑难条目继续检索,利用用户可访问的文献完成原文复核,并同时修订参考文献文件与正文。这样,来源核查能够持续影响稿件的形成过程,研究者也可以在同一任务中检查来源、更正记录与最终表述。

这些流程的有效性仍须由具体任务的核验结果检验。保留了哪些文献,哪些条目经过更正、替换或排除,以及哪些检查尚未完成,都应有可追溯记录。这些材料供作者复核稿件,也可以作为整理 AI 使用声明中验证过程的依据。未完成核验的引用不得作为已确认来源进入定稿,是 LightRead 在这一过程中的明确要求。