AI 结果要人工复核。做法是:输出附依据位置,按风险划定必须人工确认的范围,低风险结果抽检,保留调用与修改记录,出错能回溯到模型和资料。
要点速览
- AI 只做整理、初审和风险提示,判断与确认归人工
- 每条输出要标注来源位置,标不出来源的列为重点核查
- 按风险分三档:必须确认、抽检、可直接使用
- 同时保留 AI 调用记录和人工修改记录,两者能对上
- 出错要能回溯到模型、资料版本和提示词
企业用 AI 处理资料,结果要不要人工复核?要,而且要有章法。比较稳妥的做法有五个。第一,让 AI 的每条输出都带上依据位置。第二,按业务风险划出必须由人确认的范围。第三,对低风险结果做抽检,而不是逐条全检。第四,把每次调用和人工修改都留下记录。第五,出了错,能回溯到当时用的模型和资料。在这套机制里,AI 承担整理、初审和风险提示,判断与确认始终由人来做。
「说得很像对的」,才是麻烦所在
大模型输出的特点是语气笃定、格式整齐。即使内容有偏差,读起来也很顺。人看惯了这种流畅,很容易放松警惕,把「写得像样」当成「内容正确」。
实际使用中,常见的问题大致有几类:
- 引用了资料里并不存在的条款、数字或日期;
- 把两份相似文件的内容混在一起;
- 资料里本来模糊的地方,被写成了确定的结论;
- 遗漏了关键的例外条件或附加说明。
这些问题未必频繁。但一旦落到合同意见、税务处理或对外答复上,代价往往高于前期节省下来的时间。所以复核不是对 AI 不信任,而是给它的产出加一道必要的工序。复核机制的目标也不是让 AI 不出错,这一点谁也承诺不了。它要做到的是:错误能被发现、被定位、被纠正。
做法一:要求输出附带来源或依据位置
复核效率低,很多时候是因为复核人要把原文从头再读一遍。解决办法是在提示词或流程里规定输出格式:每条结论后面标注来源文件名,以及页码、条款号或段落位置。资料里找不到依据的,要明确写出「未在资料中找到依据」。
这样做有两个好处。复核人只需对照原文核一下对应位置,不必通读全文。凡是标不出来源的结论,会自动成为重点核查对象。具体要求可以写成三条:
- 依据粒度到条款或页码,只写文件名不够;
- 区分原文与推断,资料原话和 AI 自己的归纳要分开标注;
- 不得编造来源,没有依据就如实说明,宁可留空。
做法二:按场景划分哪些结果必须人工确认
不同输出的风险差别很大,一刀切地全部复核或全部放行都不合适。比较实用的是分成三档:
- 必须人工确认:对外发出、涉及金额、涉及法律责任或合规判断的结果,例如合同条款意见、税务处理建议、给客户的正式答复。
- 抽检即可:内部整理类工作,例如会议纪要、资料分类、文档摘要。
- 可直接使用:格式转换、错别字校对等辅助工作,出错影响小,也容易被发现。
分档要写进制度,并为每一档指定确认人,避免出现「大家都以为别人看过」的情况。分档也不是定下就不动。某类结果在抽检中问题偏多,就把它上调一档。
做法三:抽检而不是全检
全检看起来稳妥。但如果每条结果都要人重做一遍,AI 就没有省下时间,复核人也会因为疲劳而走过场,效果反而打折。更可行的是对「抽检即可」那一档按比例抽查。比例由企业根据业务量和容错度自己定。刚上线时可以高一些,运行稳定后再逐步调整。
抽检有几点值得注意:
- 随机抽取,不要只挑看起来规整的结果;
- 新场景上线、刚更换模型、刚更新资料的时段,临时加大抽检力度;
- 抽检结果要记下来:抽了多少、发现了哪类问题、怎么处理的。
这份抽检记录本身,就是下一轮调整分档和比例的依据。
做法四:保留调用与修改记录
留痕要留两类。
- AI 侧的调用记录:谁、在什么时间、用了哪个模型、输入了哪些资料、得到了什么输出。
- 人工侧的修改记录:复核人改了哪些地方、为什么改、由谁确认。
两类记录能对上,才说得清一份结论里哪部分出自 AI、哪部分经过人工修改。
实践中常见的情况是,员工各自用不同账号、不同工具调用模型,记录散落在各处,甚至根本没有。建议先把调用入口收拢,至少做到同一个业务场景走同一个入口。记录的保存期限,按行业要求和企业内部制度确定。
做法五:出错后能回溯到所用的模型和资料
发现错误后,要能回答三个问题:
- 当时用的是哪个模型;
- 当时检索或提供给它的是哪些资料,是不是旧版本;
- 提示词或处理流程有没有变过。
答得上来,才能判断问题出在模型、资料还是流程,然后对症处理:调整模型选择、更新资料,或者修改提示词与分档规则。答不上来,就只能笼统地说一句「以后注意」。
资料版本是容易被忽视的一环。同一份内部制度改过三版,知识库里三版都在,AI 引用了旧版,结论自然出错。上线前怎么清理和整理资料,可以参考企业知识库上线前要整理的五类资料。
放到法律和财税场景里看
合同条款初审
AI 可以把合同按条款拆开,对照企业的标准模板或审查要点标出差异,提示付款、违约、管辖、保密等条款中的风险点,并注明对应条款位置。律师或法务人员拿到的是一份带标记的清单,逐条判断是否接受、如何修改。某个条款是否构成风险、谈判怎么推进,由专业人员决定,AI 不给结论性意见。
票据资料整理
AI 可以把票据和凭证按类型、期间、金额归类,提取关键字段,标出字段缺失、金额不一致、疑似重复等问题。会计或税务人员复核被标记的项目,同时对未被标记的项目做抽样核查,防止漏标。税务处理口径和申报数据,由专业人员确认并签字。
两个场景有一个共同点:AI 产出的是「等待人来判断的材料」,而不是「判断本身」。
为什么模型和资料统一管理,复核会省力很多
上面五个做法,用人工表格也能做,但调用量一上来就很难维持。难点集中在两处:一是模型调用分散,记录难以汇总;二是资料散落各处,来源难以追溯。
润迅的 MaxModel 是模型统一管理平台,通过一个 Key 接入多家大模型,提供多模型路由与调用审计。放在复核这件事里,它解决的是调用入口收拢和调用记录可查。哪个场景用了哪个模型,有据可查。某个模型表现不稳定时,可以在路由层面调整,不必每个业务各改一遍。关于多模型带来的可用性考虑,可以参考当主流大模型同时「掉线」时企业该怎么办。
MaxKnow 是企业知识管理平台,横向支撑各行业应用。资料从个人电脑、群文件里收拢到企业自有的知识平台上统一管理,做法一的「标注来源」和做法五的「回溯资料」就有了一个共同的出处,不必再到各处翻找。
对需要私有化部署的企业,MaxDeploy 以 R30 私有化硬件、XunOS 和 MaxModel 作为基座交付,MaxKnow、MaxControl 等企业产品运行在其上。算力、模型管理和知识平台放在一套体系里规划,调用记录和资料的管理口径更容易统一。部署环境和数据边界的具体安排,建议在方案阶段按企业自身要求逐项确认。具体落地环节可参考企业私有化部署 AI 的五个环节。
一份可以直接照用的复核自查清单
如果企业已经在用 AI 处理资料,可以先对照下面这份清单逐项检查:
- AI 输出是否要求标注来源文件和具体位置?
- 是否区分了资料原文与 AI 推断?
- 是否明确要求「找不到依据就说明」,不允许编造?
- 是否把业务结果分成必须确认、抽检、可直接使用三档?
- 每一档是否指定了确认人?
- 抽检比例是否明确,是否随机抽取?
- 换模型、更新资料后,是否临时加大抽检?
- 是否保存了调用记录:人员、时间、模型、输入、输出?
- 是否保存了人工修改记录和确认人?
- 出错时,能否查到当时的模型、资料版本和提示词?
- 知识库中的旧版资料是否已清理或标注?
- 是否定期根据抽检结果调整分档?
建议先挑一个风险适中、使用频率高的场景试行。跑一两个周期,看抽检发现的问题类型和处理时长,再推广到其他场景。如果希望了解 MaxModel 的调用审计与多模型路由在企业里怎么配置,可以拨打润迅业务热线 400-854-5566 沟通具体需求。
常见问题
大模型的输出需要人工复核吗?
需要。大模型输出语气笃定、格式整齐,即使内容有偏差也读起来很顺。涉及对外答复、金额、法律责任或合规判断的结果,应由专业人员确认;内部整理类结果可按比例抽检。
AI 回答不可靠怎么办?
先要求输出标注依据所在的文件和位置,找不到依据时如实说明。再按风险分级复核:高风险结果人工确认,低风险结果抽检,并记录问题类型,据此调整资料、模型或流程。
企业 AI 的调用记录应该留存哪些内容?
建议至少记录调用人、时间、所用模型、输入的资料与指令、得到的输出,同时保留人工修改内容和确认人。保存期限按行业要求和企业内部制度确定。调用入口尽量统一,便于汇总查询。
AI 结果全检还是抽检?
全检会抵消 AI 节省下来的时间,复核人也容易疲劳走过场。更可行的是:高风险结果逐条确认,内部整理类结果随机抽检。新场景上线、换模型或更新资料后,临时提高抽检比例。
AI 出错后怎么查原因?
需要回溯三件事:当时使用的模型,当时提供给它的资料及版本,提示词或流程是否有变化。查清这些,才能判断是模型、资料还是流程问题,再针对性处理。前提是事先留好调用记录。