知网AI查重:研究生适用范围与基础规则科普

查重降重实务:机制、报告与改写方法 约 6 分钟
本文目录

1. 知网AI查重是什么?核心定义与推出背景

知网AI查重是中国知网于2024年正式推出的AI生成内容识别模块,是知网查重系统针对大模型学术应用场景进行迭代升级的重要功能,直接嵌入到已经成熟的学术不端检测系统架构当中,并不是独立于知网常规查重服务的第三方工具。

该功能上线的行业背景十分清楚,近些年来ChatGPT等通用大模型工具迅速普及,很多学生、科研人员开始使用AI工具来辅助文献整理、内容润色甚至直接生成学术段落,在某些情况下出现了AI内容不当使用、完全由AI代写而没有标注的学术失范问题,传统的只能对比文字重复的查重体系已经不能涵盖这些新的学术风险点。

根据知网官方公布的上线历程,AI生成内容识别模块在2023年就开始了小范围的高校试点工作,2024年完成了全量高校学位论文库的训练之后才正式对所有的合作学术机构开放,目前服务主体范围只限于知网签约的正规学术机构,所有的功能规则都与知网官方发布的《学术不端检测系统AI生成内容识别服务说明》一致。

不少双一流高校的研究生在预答辩前的图书馆查重端口,第一次拿到带有AI生成内容占比标识的检测报告,很多人第一反应是分不清这份结果和传统文字复制比报告的区别——这也是大多数用户在认知阶段最核心的困惑,新增的AI查重到底是什么功能,和自己之前用的知网查重有什么本质的不同。

2. 知网AI查重的核心识别原理与技术特点

知网AI查重的识别逻辑与市面上其他通用AI检测工具完全不同,根据知网官方发布的《学术不端检测系统AI生成内容识别服务说明》,它依靠全量高校学位论文库作为主要的训练数据集,而市面上的通用AI检测工具只使用公开网页内容进行训练,两者之间存在着本质的区别,主要使用三种类型的多维识别算法来提取文本特征

第一类是文本语义特征识别,比较目标文本和知网已经收录的千万级文献的表述习惯、术语搭配逻辑的不同,找出AI生成内容常见的“过度书面化、泛化表述没有精准的研究方向”等典型特征;

第二类是生成痕迹特征识别,对大模型输出时经常出现的固定句式、连接词使用规律、重复逻辑闭环等独特的痕迹进行定向匹配;

第三类是行文逻辑特征识别,看文本段落之间论证的跳跃、实验数据的关联、观点的递进是否自然,剔除AI生成内容中常见的逻辑断层、前后自相矛盾的内容。

普通用户公开实测的不同类型文本的AI识别阈值可以作为基础参考,纯AI生成的科普类文本识别准确率大于95%,经过少量人工调整的AI生成文本识别率在60%到80%之间,人工深度改写过的AI内容识别率小于30%,完全由人工原创的文本被误判为AI生成内容的概率小于5%。

很多用户第一次接触知网AI查重的时候,很容易把它同传统的知网查重混淆起来,两者的技术边界十分清楚

  • 传统知网查重的核心逻辑就是数据库字符匹配,把上传的文本同高校学位论文库、期刊库等资源进行13字符连续比对,最后得出文字复制比,主要识别的是“已发表内容的文字抄袭行为”,不涉及内容的生成主体判定;

知网AI查重的核心逻辑就是文本特征提取训练,不需要将内容与某一篇具体的文献进行对比,只需要通过模型学习到的AI生成文本通用特征来判断该段落是由大模型生成的概率,主要识别的是“非人工原创的AI生成内容属性”,即使是完全没有在任何公开数据库发表过的全新AI生成文本,也能够被准确地识别出来。

依靠知网海量的自有学术文献库训练出来的专属检测模型,相较于通用AI检测工具而言,最大的技术优势就是适合学术文本的专属表达体系,很多通用AI检测工具对于专业术语密集的理工科论文容易出现误判,但是知网AI查重已经学习了近二十年的全量高校学位论文的专业表述习惯,对于不同的学科专业术语、实验报告格式的适配性非常高,大大降低了学术场景下的误判概率。

3. 知网AI查重的适用场景与使用人群范围

根据知网官方公示的服务授权规则,知网AI查重的适用场景和人群有非常明确的边界,并不是所有的场景文本都可以提交该服务检测。

3.1 官方明确的合规适用场景

知网AI查重的核心服务场景全部围绕学术审核需求展开,主要包含三种场景:

1. 高校本硕博学位论文提交前检测:各高校在终稿查重环节同步进行AI生成内容排查,作为学位论文质量审核的补充依据;

2. 学术期刊投稿初审检测:国内多家核心期刊已经把知网AI查重加入到投稿初审流程中,排查投稿稿件中是否有未标注的AI生成内容;

3. 科研项目结题成果审核:部分科研院所在横向、纵向项目结题验收时,用该工具对提交的研究报告内容进行AI生成属性筛查。

3.2 授权使用人群边界

知网AI查重目前的授权链路是严格的机构定向授权模式,只对合作高校、科研院所、正式学术期刊编辑部等机构开放,不支持个人直接购买使用。

授权链路内终端使用人群为机构管辖范围内的学生、科研人员、投稿作者,必须通过所属机构官方专属端口提交检测。很多用户不知道普通用户和高校机构使用的知网AI查重端口权限不一样,个人直检入口(如果有非官方的所谓个人通道)不能获得完整的AI片段溯源标注,只有高校图书馆专属端口可以看到报告中标记的疑似AI生成段落的准确位置。

知网官方明确列出了不能使用的场景,非学术类文本检测、商用文稿检测都不在服务范围内,知网也从未授权任何第三方商用AI文稿检测平台使用其AI生成内容识别技术。市场上有很多声称可以个人直检知网AI查重的第三方平台,这些平台都是假冒的,检测结果没有任何学术参考价值,而且存在用户论文被违规收录泄露的风险。

很多双一流高校的硕士研究生都有第一次使用的真实经历,某双一流高校硕士在预答辩前将论文提交到学校图书馆检测端口,第一次得到带有AI生成内容占比标识的查重报告,对照报告标注的片段确认了自己用AI工具辅助润色的讨论部分,之后按照学校院系的要求提交了该部分内容的人工修改说明,顺利通过了预答辩环节,这也是目前高校学生接触知网AI查重最主流的方式。

4. 知网AI查重的官方规则与结果解读说明

所有的知网AI查重运行规则、结果定义都严格按照知网官方发布的《学术不端检测系统AI生成内容识别服务说明》来执行,没有任何超出公示范围的隐藏规则。

知网AI查重完整的运行流程是用户在机构授权端口上传合规格式的论文文档→系统启动双引擎同步检测,第一引擎进行常规的文字抄袭比对检测,得到传统的文字复制比结果,第二引擎启动AI生成内容多维度特征识别,提取疑似AI生成的段落并计算占比→系统把两种检测结果合并整合→最后生成带有AI占比标注的正式查重报告。

很多初次拿到报告的用户很容易把报告中的各个指标弄混,知网官方公示的知网AI查重常见指标及含义对照表如下所示。

报告指标名称官方定义结果用途说明
常规文字复制比文本与知网已收录文献的重复字符占总字符的比例用于判定传统文字抄袭、引用不规范的程度
AI疑似生成占比模型判定为高概率AI生成的字符占总字符的比例用于提示学术审核人员该内容存在AI生成风险
AI可疑段落标注报告中用特殊底色单独标记的疑似AI生成的文本段落便于定位AI生成内容的具体位置,方便后续人工核验
引用率文本中规范标注引用格式的字符占总字符的比例用于区分合规引用内容和抄袭内容,不计入总复写比

根据知网官方的公开说明,知网AI查重不会直接对论文是否合格做出判断,只会给出AI生成内容所占比例的标识,最终的内容审核权完全由提交检测的高校院系来行使。目前国内不同高校执行的AI占比审核阈值并不统一,大多数高校要求学位论文的AI疑似生成占比低于30%,部分人文社科类专业的审核阈值会更加严格。

如果用户对知网AI查重结果有异议,可以按照所属机构的申诉程序,向院系提交该部分内容的创作底稿、实验原始数据、修改过程版本等证明材料,申请人工核验,最终审核结论以院系的人工核验结果为准。

5. 知网AI查重的常见使用注意事项

所有使用知网AI查重服务的学术人员必须遵守知网官方公示的使用规范和所在高校的学术要求,以下是主要的注意事项

第一,不能把纯AI生成的内容不经过人工修改就直接当作学术成果提交。目前全国大部分高校的学术规范都明确规定,AI工具只能起到辅助写作的作用,不能替代作者进行核心研究结论、原创观点、实验推导过程等工作,如果直接提交纯AI代写的内容,一经人工核验发现,就会被认定为学术不端行为。如果利用AI工具对部分段落进行润色、文献整理等工作,那么需要按照学校要求在论文的致谢或者作者声明中注明AI工具的使用范围。

第二,提交检测的文档要符合知网系统格式要求,最好用Word或者PDF格式上传,不要上传带有大量加密格式、图片嵌套异常的文档,否则会影响AI生成内容特征提取的准确性,从而增大误判的可能性。在日常写作中,增加个人原创实验数据、补充专属研究逻辑表述、加入独有的实地调研内容等操作都可以有效地降低无意义的AI内容误判概率。

第三,严格按照学术规范的要求使用知网AI查重服务,不得将知网AI查重服务用于任何非学术用途,也不要相信非官方渠道所谓的“知网AI查重”服务,以免自己的未发表论文被第三方平台违规收录,在投稿时被知网常规查重判定为重复内容,影响正常毕业或者投稿。

常见问题

常见问题

共 4 个问题,点击展开查看答案

  • 普通知网查重主要是对已收录的公开文献资源进行文字抄袭的识别,而知网AI查重新增加了针对大模型生成内容的识别模块,可以准确地检测出由AI工具生成的文本段落,两者的检测维度、识别算法以及结果标注逻辑都存在着较大的差别。

  • 不对,知网AI查重目前只对高校、科研机构等合作单位定向授权,不对个人用户开放,用户需要通过所在院校的图书馆或者指定教务渠道提交论文,才能使用带有AI检测功能的知网查重服务。

  • 目前知网AI查重的识别准确率不能达到100%,对于经过人工大量改写、混合多源AI生成内容的文本会存在漏判的情况,而且部分作者原创的特殊逻辑表述也有可能被误判为AI生成的内容。

  • 是的,升级后的知网AI查重报告会单独展示AI生成内容疑似占比,并且对判定为AI生成的段落进行特殊标记,与常规的文字复制比结果分开展示,使用户可以清楚地看到原创内容、引用内容和AI生成内容的占比。