1. 知网AIGC检测的基本定义及推出背景
知网AIGC检测是中国知网推出的、嵌入知网学术不端检测系统的专门识别AIGC生成文本的学术审核工具,所有功能定义均来自知网发布的《学术出版AIGC内容合规检测规范》公告。
近些年来,由于ChatGPT等生成式AI工具在高校科研、学术创作中得到了广泛的应用,许多师生开始使用AI工具来辅助完成文献综述的撰写、数据结果的整理等工作,但是也存在着一些创作者过分依靠AI生成完整的学术内容,并且直接把AI产出的内容当作原创成果提交的现象,传统的知网学术不端查重系统只能识别出和已公开文献重复的抄袭内容,对于完全由AIGC工具生成、没有出现过现有文献重复片段的学术文本来说,它是无法辨别的。根据这个学术规范管理的新需求,中国知网在原有的知网学术不端检测系统基础上,又新增了AIGC生成文本的识别子模块,它是对原有查重功能的一种重要补充,而不是取代原有的重复率检测服务,其主要定位就是给高校、科研机构提供学术创作全流程的合规性核验工具。
与市面上的第三方AIGC检测工具不同的是,知网官方公示的规则明确表示,知网AIGC检测只部署在高校学术审核平台端,不向普通个人用户单独开放购买通道。知网官方2023年对外公示的首批试点高校覆盖范围,包含北京大学、清华大学、浙江大学等39所双一流建设高校,以及12所国内重点政法、医药、理工类专业特色院校,试点阶段所有检测服务均定向对接高校研究生院与学术管理部门,不对非合作主体开放功能权限。
为了使初次接触相关规则的师生能够迅速地分辨出不同之处,现将知网AIGC检测同市面上常见的第三方AIGC检测工具的3个主要区别归纳如下:
2. 知网AIGC检测的核心技术原理
知网AIGC检测的核心识别模型,是依靠知网独家拥有的海量学术文本数据进行训练的,并且对学术类文本的创作特点做了专门的优化,技术逻辑和传统的查重方式——数据库比对有着根本的不同。根据知网学术不端检测中心发布的功能说明文档可知,该工具的识别逻辑不是通过将待检测文本与已有的文献库进行重复片段匹配来实现的,而是直接从文本本身所具有的生成特征入手来做出属性判断,主要分为以下三种官方明确公示的识别依据
第一类为文本语义连贯性特征识别,知网模型会逐段分析各个段落之间的逻辑联系、上下文衔接是否自然,从而判断出是否存在AI生成文本中常见的“虽然语句通顺但是核心观点逐渐发散、前后论证没有强关联”的情况。
第二类为生成式模型常见句式标识识别,对主流大模型输出的学术内容中经常出现的固定表述方式、句式结构、虚词搭配习惯等进行特征提取,标记出符合AI生成规律的文本片段。
第三类是非原创逻辑跳转节点识别,识别人工创作过程中很少出现,但是AI生成时经常出现的无铺垫跳转新观点、无来源给出精准数据、前后论点矛盾不自知等特殊的逻辑节点。
不同于市面上很多同类工具只能对整个文本进行整体判断,知网AIGC检测可以准确地定位到具体的疑似生成片段的位置,即使用户对AI生成的内容做了局部修改,只要保持原生成内容的核心句式和逻辑特征,仍然可以被模型识别出来。
3. 知网AIGC检测的适用人群和覆盖场景
知网AIGC检测属于学术场景专用的合规性核验工具,其服务对象及使用场景均存在官方明确的限定范围,并不对非学术类的检测需求开放。根据知网官方公示的服务说明可知,该检测的适用主体为高等院校毕业生、硕博研究生、在岗科研人员、期刊投稿作者这四类主要人群,所有的检测请求都必须通过用户所在机构的端口发出。
知网AIGC检测适用场景分布占比图
从目前已公开的试点高校使用数据可以看出,知网大学生论文AIGC筛查最主要的使用场景占比分布是:毕业论文盲审前置筛查占60%、期刊投稿初审占25%、日常课程作业质量核验占10%、科研项目申报材料审核占5%。各个场景具体的应用规则都被包含在相应的高校学术管理体系当中,例如毕业论文环节的知网AIGC检测结果会被当作盲审之前的初筛标准,期刊投稿场景下知网学术不端AIGC识别规则也被国内几百本核心期刊加入到投稿初审流程里。
知网官方也明确表示,该服务暂时不支持商用文案检测、普通自媒体内容检测、非学术类文本的AIGC鉴定等超出学术场景的需求,非学术类文本上传之后不能完成有效的检测,也不会生成符合规范的检测报告。
这里可以借鉴某双一流高校硕士研究生真实使用场景的案例,该生提交课程小论文之后,学院统一通过高校学术审核平台进行知网AIGC检测,得到的检测报告中标注了12%的疑似AIGC生成片段,这些片段主要分布在他使用AI工具整理的研究背景部分,之后学生对标记段落进行了人工创作说明,并附上了自己整理的原始文献笔记,最终通过了审核。该案例也符合目前国内高校对于AIGC检测结果的常规处理流程,并没有出现直接标记不合格的情况。
4. 知网AIGC检测结果的构成与解读方式
知网AIGC检测报告是该服务最终的输出载体,与普通的知网查重报告有明显的字段区别,所有的标识含义都在知网官方的《学术出版AIGC内容合规检测规范》中进行了明确的定义。一份完整的知网AIGC检测报告主要包含三个部分,分别是:
1. AIGC生成总占比统计:用百分比数值的形式表示整份文档中疑似由AI生成的内容占全文总字符数的比例,例如案例中课程小论文的总占比为12%;
2. 疑似AI生成片段定位:报告中会用不同的颜色准确地标记出疑似AIGC生成的文本段落,直接对应原文的相应位置,便于创作者有针对性地进行补充说明;
3. 原创内容标注区域:报告中还会用专属标识标出经过模型判定为纯人工原创的文本部分,供后续学术审核使用。
对于不同的AIGC生成占比区间,国内试点高校目前普遍使用的参考判定标准是:总占比小于10%的文本,直接判定为原创合规;10%到30%之间的文本,提示创作者对疑似片段补充人工创作说明后即可通过;超过30%的文本会自动触发人工复核流程,由院系的学术审核老师逐个核对内容创作真实性。知网官方也明确指出,知网AIGC检测结果只能作为学术审核的辅助参考,不能直接认定学术不端,不能跳过人工审核直接得出结论。
知网AIGC检测与普通查重服务的主要区别
很多师生会把知网AIGC检测和普通的学术不端查重功能边界弄混,从官方给出的技术定义来看,两者的主要区别在于三个完全不同的方面
第一是检测目标不同:知网常规查重的核心就是对比已经公开的文献文本重复片段,判断待检测内容和已有文献的重合抄袭比例;而知网AIGC检测是从文本语义连贯性特征、生成式模型常见句式标识、非原创逻辑跳转节点这三个方面来判断内容的人工原创属性,两者的检测目标完全不一样。
第二是数据库依赖不同:普通知网查重结果的准确性完全依靠知网收录的大量文献数据库的覆盖面,对于没有公开的私有文献内容无法进行比对;而知网AIGC检测结果并不依靠已经存在的文献数据库,主要依靠AIGC生成特征模型的训练程度,即使是原创度100%、没有和任何现有文献重复的AI生成文本,也能被模型识别出来。
第三是结果的应用场景不同,查重结果主要是用来判断学术内容是否存在抄袭行为,满足高校对重复率的要求,AIGC检测结果主要是判断学术创作过程中是否存在过度依赖AI生成、完全缺乏人工独立思考的学术不端风险,辅助学术管理部门规范创作过程。
5.关于知网AIGC检测的常见认知误区澄清
目前网络上流传着很多关于知网AIGC检测的不实信息,很多都与知网官方公布的规则相违背,我们根据知网发布的《学术出版AIGC内容合规检测规范》以及知网学术不端检测中心的公开说明,整理出最容易误导用户的三种认知误区,并附上知网官方明确给出的合规说明。
常见问题
常见问题
共 4 个问题,点击展开查看答案
-
主要支持硕博毕业论文、本科毕业设计、期刊投稿论文、高校课程作业等学术类文本的AIGC生成内容识别,暂不支持图片、音频等非文本格式内容的检测。
-
知网AIGC检测暂不面向个人用户开放,仅对高校、科研机构、期刊编辑部等合作单位开放使用权限,个人需要通过所属院校或投稿期刊提交检测申请。
-
不会,AIGC检测结果只起到辅助判定的作用,机构会根据人工审核来判断内容是否属于不合理的AI生成滥用,不会把AIGC标记的内容直接等同于学术不端。
-
知网AIGC检测可以对连续多段AI生成内容进行识别,即使是碎片化的小篇幅AIGC改写内容,只要结合上下文特征分析就会被筛查标记,没有固定的字数阈值。