用AI写研究计划书会被看穿吗——AI幻觉、日文文献与“原典核实”的方法

作者:贞村真宏(东京大学法务博士〔专业学位〕)

用AI写研究计划书,教授会不会看出来——这是这两年被问得越来越多的问题。

这个问题的问法本身有点偏。真正决定成败的,不是“你用没用AI”,而是“这份计划书里的每一条引用是不是真的存在、你是不是真的读过”。而这两件事,恰好是当前的AI在日语学术与法律文献上最不擅长的地方。

一、先把结论说清楚:用AI起草,本身不是问题

我自己的研究方向之一是可解释AI(XAI)——让机器的输出变得可核查、可追问。所以我不会写一篇“不要用AI”的文章,那既不现实,也不诚实。

现实是:日本的研究生院里,教授和学生都在用生成式AI。用它把模糊的想法整理成结构、把中文构思先转成日语的骨架、列出可能的检索关键词——这些都是合理的起点,效率上没有理由放弃。

所以教授在意的从来不是“这是不是AI写的”。审查一份研究计划书,看的是三件事:你的问题是否成立;这个问题此前被做到了哪一步;你打算用什么方法往前推一步。AI能把这三件事写得像模像样,却不能替你完成其中任何一件。

被扣分的从来不是AI,而是下面这三个具体的结果。

二、三个结构性风险

(a)引用幻觉:不是偶尔出错,而是结构性的

语言模型生成的是“在统计上最像正确答案的下一串字符”。当它引用一篇真实存在、且被大量数字化转载的英文论文时,正确的字符串就在它的参数里,命中率相当高。但当它被要求引用一篇从未数字化、公开互联网上根本不存在的日文文献时,它没有可以回退的事实——于是它做它唯一会做的事:把格式补全

结果就是一条形式上无懈可击、实质上不存在的引用。以下是典型模式的例示(这是对常见形态的归纳,不是某一次具体测试的记录):

(本文刻意用“○”代替具体数字。虚构的编号一旦写实,就可能被检索到、被再次引用——这本身就是问题的一部分。)

需要强调的是:越是格式规范的引用,越容易让人放松警惕。就不接检索、仅凭参数生成的情形而言,这也不是“等模型再强一点就会消失”的缺陷,而是“训练数据里没有的东西无法被生成出来”这一结构本身;接入检索或联网(RAG)可以缓解,但缓解的前提是被检索的资料本身在线——这正是下一节要说的问题。

频率上,法律领域已有可引用的实测研究。斯坦福大学 RegLab/HAI 团队的两项研究经同行评审后发表:Dahl, Magesh, Suzgun & Ho, “Large Legal Fictions: Profiling Legal Hallucinations in Large Language Models,” Journal of Legal Analysis 16(1), 64–93 (2024) 报告通用大模型在针对随机抽取的美国联邦判例所提的、可直接验证的问题上hallucinate at least 58% of the time”(至少58%的情形出现幻觉);Magesh 等,“Hallucination-Free? Assessing the Reliability of Leading AI Legal Research Tools,” Journal of Empirical Legal Studies 22(2), 216–242 (2025) 则发现,即便是接入了法律数据库的专业检索工具(Lexis+ AI、Westlaw AI-Assisted Research 等),幻觉率仍在“between 17% and 33% of the time”。这两项研究的对象是美国法与英文资料;日语原典的在线比例更低,情况只会更差,但目前没有针对日语法学文献的同类实测数据可引——因此本文对日语环境的判断,是笔者的实务观察,而非实测值。

(b)同质化:教授一年读几十份同一种文体

一个申请季里,教授会读几十份研究计划书,其中相当一部分出自同一批工具。于是同一种段落结构、同一种连接方式、同一种谨慎到没有立场的问题设定,反复出现。

这里的风险不是“被认定为作弊”,而是更平淡也更致命的一件事:读起来没有作者。研究计划书评的是一个人的判断力——为什么选这个问题而不是那个、为什么接受这个前提而怀疑那个。当文本被磨得毫无棱角,评审者看不到判断,只能看到一份合格的模板。

顺带一提,这也是为什么“代写”产业的产品在日本这边并不好用。申请文书被中介虚假“包装”甚至擅自篡改的问题,已被中国官方媒体公开报道;审查方比申请人更早知道这类产业的存在。

(c)先行研究的空洞

AI没有读过那些文献的实物,所以它写出来的“先行研究”往往长这样:“关于本主题已有一定的研究积累”“既往研究主要从A与B两个角度展开”。听上去很像样,但没有任何一句能落到某位研究者的某个具体主张上。

而先行研究恰恰是整份计划书里唯一能证明“你已经进入这个学术共同体”的部分。它的功能不是显示你读得多,而是把你的问题定位在一张已有的地图上:谁做到了哪一步、卡在哪里、你要补的是哪一块。这一段空洞,后面所有的方法论设计都会失去意义。

三、为什么在日语环境里尤其严重

上面三点在任何语言里都成立,但在日语环境里会被显著放大。原因是一个很朴素的事实:日本的学术与法律信息,对AI来说是低资源语料

把这些加起来只有一个结论:中文与英文世界里“上网就能查到”的直觉,在日文原典上不成立。AI读不到它们,不是因为模型不够强,而是因为它们不在网上

这里需要区分两件事,否则容易走到另一个极端。J-STAGE等平台确实公开了大量全文——据其官方介绍,收录来自2,400余家发行机构的4,000种以上期刊与会议录,其中九成以上的文章可免费阅览——这一部分AI也能读到。读不到的是没有进入这些平台的部分:纸质的判例评释、未数字化的大学学报(紀要)、立案担当者的解说,以及只有书目在线的旧刊。所以真正的难点并不是笼统的“AI读不到日文”,而是AI分不清哪一条是它真的读过的、哪一条是它按格式补全出来的

这里还有一个中文母语者特有的陷阱:汉字带来的错觉。能读懂汉字,确实让中文母语者在日语文献上的起点更高——但同形异义词、以及日语学术文体特有的委婉论证方式,恰恰因此更容易被误读。“看得懂”与“能准确引用”之间,隔着一整套学术规范。

四、会怎样被发现

很多人以为“查引用”是一件麻烦事。对教授来说不是——那是他每天都在做的事。

更重要的是被发现之后的性质。日语不够好、研究设计不成熟,属于能力问题——能力问题可以补,教授也见惯了。但引用了不存在的文献,性质完全不同:它会被归入诚信问题。日本的研究伦理框架把捏造、篡改、剽窃列为“特定学术不端行为”(文部科学省《关于应对研究活动中学术不端行为的指南》,日文原名:研究活動における不正行為への対応等に関するガイドライン)。出愿阶段的研究计划书当然不直接适用那套惩戒程序,但读你计划书的人,判断标准来自同一套职业伦理。

这就是这件事真正的不对称之处:能力上的不足可以在入学后补上,诚信上的怀疑没有补救的机会。

五、正确的工作流:不是“抹掉AI”,而是“逐条回到原典核实AI”

如果结论是“别用AI”,这篇文章就白写了。正确的做法不是把AI的痕迹擦掉——那只是化妆——而是把AI给出的每一个事实性主张,换成有出处、你自己读过的东西。

第0步:让AI做它擅长的事——发散,而不是断言。
让它列出可能的研究角度、可能的日文检索关键词(同一个概念在日语里往往有好几种表述,这一步AI非常有用)、把你的中文构想转成日语学术表达的初稿。原则是:让AI提供检索的入口,不让它提供事实。

第1步:起草时先立规矩。
在提示里明确要求:需要引用的位置只留空标记(例如写成“[要出典]”),不要自行填充文献。如果它已经填了,就把每一条都当作“未经验证”处理——包括那些看起来最可信的。

第2步:全量核实与替换(这一步是全文的核心)。
建一张引用台账,每条引用一行,至少五列:①这条引用支撑的主张 ②AI给出的出处 ③核实结果(存在/不存在/存在但不支持)④实际出处(含卷号与页码)⑤你用一句话写下的该文献要点。

处理规则只有三条:

  1. 存在且相符 → 保留,补上准确页码。
  2. 存在但不支持这个主张 → 要么改写主张,要么更换出处。这一类最容易被放过,也最危险。
  3. 不存在 → 删除。然后回到检索,重新去找真的说过这件事的人。

请注意顺序:不是“把假引用换成真引用”,而是先有阅读,再有引用。前者只是把幻觉洗白,后者才是研究。

第3步:真的去读日文先行研究,并据此重建结构。
选3~5篇核心文献,向后追它们的参考文献、向前追引用它们的后续研究,把这条引用链走一遍。然后用自己的话写出三句:既往研究做到了哪一步/还剩什么没有解决/我要补的是哪一块。这三句话是整份计划书的心脏,也是面试必问之处。它必须由你来写。

第4步:做一次“面试耐受性”自检。
对每一条引用问自己:我能不能用两句话说清这篇文章讲了什么、以及它为什么与我的问题有关。答不出来的,删掉。一份引用不多但每条都站得住的计划书,远胜过一份引用密集却经不起一问的。

第5步:最后才轮到语言润色,这一步可以再交给AI。
顺序很重要:先核实事实,再打磨语言。反过来做,等于给假货打蜡。

六、自查清单:把引用一条一条核实

6-1 期刊论文与大学纪要

判定原则:查不到 ≠ 不存在(很可能只是没有数字化)。但如果既查不到书目、也说不出它的实体所在(哪本刊、哪一卷、哪家图书馆有),就按不存在处理。

6-2 判例与法条

6-3 图书与纸质资料

(以上各项的日文原名与网址见文末“参考资料”,检索时用日文原名更容易找到。)

6-4 三个一分钟检查

  1. 页码。AI给出的引用几乎从不带准确页码。没有页码的引用,一律重查。
  2. 卷号与年份的对应关系。这是最常见的破绽,对一下该刊的发行年表即可。
  3. 你能不能说出这篇文章的结论? 说不出,就说明你没读过;没读过,就不要引。

6-5 按处境的最小方案

结语

AI不是“要不要用”的问题,而是“用到哪一步为止”的问题。

我自己的研究方向之一是可解释AI——让机器的输出变得可核查、可追问,本来就是这个领域的主题。研究计划书也一样:AI可以给你一个高效的起点,但“核查”这一步不能再外包给AI,只能由你自己、或者由能真正读到日文原典的人来完成。

把这一步做完之后,你的计划书就不再是“AI写的”了。它是有出处的


如果你已经有一份AI写的初稿,却不知道其中哪些引用是真的:本站提供 AI回答引用核实(逐条核对日本判例、法条、文献是否真实存在,返还核实报告与正确出处)与 研究计划书套餐(3个月一对一)——先行研究地图、辅导课12次、研究计划书修改12稿、联系教授的礼仪指导、模拟面试2次。能在线确认的在线核对,只存在于纸面的到国立国会图书馆等处调阅原件核对,并把该处的原文与所在信息一并交给您;不代写,也不作任何“保录”承诺。
服务与价格(AI回答引用核实) | 直接联系(中文可)

关于作者:贞村真宏。东京大学法科大学院毕业(日文称“修了”),取得法务博士(专业学位、J.D.),同行评审论文21篇。研究方向为法与心理学、量刑判断、可解释AI(XAI)与自然语言处理。

免责:本文为一般性信息,不构成任何个案建议。

本文基于公开第一手资料整理,信息截至2026年7月。

参考资料

相关阅读

最后更新: