本文是 《AI 评标的两面性陷阱》 的实操姊妹篇。那篇讲”为什么必须做”,这篇讲”怎么做不踩坑”。


开篇|评标 AI 不是”要不要上”,是”怎么上不踩坑”

发改法规〔2026〕195 号文划了两条硬时间线:**2026 年底,招标文件检测、智能辅助评标、围串标识别等重点场景在部分省市率先全覆盖;2027 年底,全国推广。**合肥已经跑完试点,湖南已经批量处罚,华电已经交出实战数据——留给观望者的窗口期,不是”两年”,是”正在关闭”。

但”上 AI”三个字,远比大多数管理者想的复杂。选错产品,合规踩坑;数据没准备,模型废掉;跳过试点直接全量,人工复核率高达 60% 以上——比不用 AI 还慢。本文整理一条从 0 到 1 的 7 步部署路径,每一步都是踩过坑的实操笔记,不是 PPT 方案。


一、部署前的 3 个认知准备

认知 1:评标 AI ≠ 让 AI 打分

这是 10 条红线 里红线 2 的核心——“不得让 AI 代替专家评标打分”。评标 AI 的正确定位是”辅助”:错漏检测、雷同性比对、价格分计算(公式型)、合规扫描。主观分(技术方案分、综合实力分)必须由专家独立给出并签字,AI 不得介入。

任何厂商 PPT 里出现”AI 自动打分”的,直接划掉。这不是能力问题,是法律红线。

认知 2:核心价值不在效率,在合规覆盖面

《AI 评标的两面性陷阱》 里有一组被广泛低估的数据:合肥”青天大模型”上线前招标文件抽检率 40%,上线后 100% 全覆盖。评审时长缩短 90% 是被传播的”效率叙事”,但真正改变游戏规则的是——此前 60% 不被审查的招标文件,第一次纳入全量检查

部署评标 AI,核心收益不是”快了 X%“,而是”合规扫描从抽样变成了全量”。认知偏差会直接导致预算分配错误——把钱全砸在”提效”功能上,却忽略了合规扫描能力的建设。

认知 3:部署顺序——先合规扫描,再辅助评审,最后风控预警

三个阶段的能力成熟度和合规风险完全不同:

阶段能力成熟度合规风险建议优先级
合规扫描(招标文件检测、清标、围串标识别)L3 成熟可用低——AI 做检测,人做决策✅ 第一批部署
辅助评审(错漏检测、雷同比对、价格分计算)L3 成熟可用中——AI 出结果,人必须复核✅ 第二批部署
风控预警(供应商画像、异常行为预警、信用评价)L2 早期可用高——涉及数据融合与算法判断🟡 第三批部署

先上线合规扫描类功能,跑通流程、建好留痕制度,再逐步叠加评审辅助和风控预警。一步到位全量上线,是所有部署坑里最大的那个。


二、7 步部署路径

Step 1:选型评估——3 个维度筛掉 80% 的厂商

市面上自称”评标 AI”的产品超过 40 家,但能在合规框架下真正可用的不到 10 家。用 3 个维度快速筛:

维度一:合规资质

  • 是否通过算法备案(195 号文 §3 第五款要求”大模型须经算法备案、安全评估等流程,取得备案号后方可正式应用”)
  • 是否有等保三级及以上认证
  • 是否支持 AI 操作留痕(工具名称、版本号、输入/输出、人工复核意见,归档不少于 6 年——红线 8 的硬性要求)
  • 是否标注”AI 辅助生成”(红线 6)

维度二:技术能力

  • 围串标识别特征维度是否覆盖 AIIA/T 0299 定义的 12 类特征(报价波动曲线重合、技术方案相似度异常、IP/MAC 重复、股权交叉等)
  • 评审因素结构化能力——能否把主观打分项转换为可量化、可证伪的客观指标
  • 是否支持”AI 初评 + 人工复核”双轨制
  • 模型可解释性——AI 给出结论时是否同步给出依据

维度三:数据安全

  • 是否支持本地化部署或私有云(红线 5:涉密及敏感数据禁止接入公有云大模型)
  • 数据分级处理能力(绿/黄/红三级,与 10 条红线中的数据分级清单对应)
  • 数据留存与销毁机制是否合规
  • 供应商数据是否隔离(不同客户的数据不能混用训练)

⚠️ 选型避坑:厂商 PPT 里”AI 评分准确率 98%“的数字,一律要求提供第三方测试报告和测试样本量。样本量低于 500 个项目的,数字不具备参考意义。


Step 2:合规评估——逐条对照 195 号文 §3 和 10 条红线

选型完成后、签约之前,做一次系统性的合规评估。这不是走过场——它决定你的 AI 系统能不能合法运行。

对照 195 号文 §3 的 3 个核心条款:

  1. “模型生成结论不替代……自主判断,不改变使用主体的法定责任” → 系统设计是否确保 AI 输出只作为辅助参考?是否存在”一键采纳”按钮?
  2. “防范模型黑箱、幻觉和算法歧视” → 系统是否提供可解释性报告?是否有幻觉检测机制?是否有算法偏见审计报告?
  3. “数据安全、模型可解释” → 数据是否分级?涉密数据是否隔离?算法是否可追溯?

对照 10 条红线逐条检查:

红线合规检查项通过标准
红线 2AI 是否仅用于辅助,不替代专家打分无”采纳 AI 评分”功能
红线 5敏感数据是否隔离,不上公有云数据分级清单 + 技术验证
红线 6AI 生成文件是否强制人工签字流程中签字为必选项
红线 8操作日志是否完整留存6 项要素齐全,6 年可查

合规评估不通过的,坚决不签。上线后再改,成本是签约前的 5–10 倍。


Step 3:数据准备——3 件事不做完,模型就是废铁

3-1:历史采购数据清洗

AI 评标的第一个输入,是你过去 2–3 年的采购数据。但 90% 的企业历史数据不具备直接使用的条件——格式混乱、字段缺失、关键信息以图片或 PDF 附件形式存在。

清洗标准:

  • 所有项目按”招标文件→评标办法→中标公告→合同→变更签证→履约评价”6 类归集
  • 字段标准化:项目名称、金额、品类、评审因素、评分记录、供应商信息统一格式
  • 时间范围:至少覆盖 24 个月,越长越好
  • 数据质量:关键字段缺失率 < 15%,超出则需补录

⚠️ 避坑:数据清洗的工时通常是预估的 2–3 倍。一家年采购额 5 亿元的中型企业,清洗 24 个月数据通常需要 3–5 人月。预算和排期务必留余量。

3-2:评审因素结构化

这是部署过程中最容易被跳过、但影响最大的一步。华电”智采”系统之所以能在 32 个项目里把 AI 清标准确率做到 90% 以上,核心不在大模型,在于——“评审因素客观化—投标响应结构化—评审尺度统一化”三步设计

实操方法:

  • 梳理现有评审因素,区分”客观可量化项”和”主观判断项”
  • 主观项尽可能转化为可量化指标(如”项目管理方案”→拆解为”进度计划完整度""人员配置匹配度""风险预案覆盖度”等子项)
  • 每个评审因素建立评分标准、参考答案或评分锚点
  • 统一投标文件填报格式,使 AI 可读取

3-3:供应商画像构建

至少为现有活跃供应商建立以下维度画像:

  • 资质业绩(资质等级、同类项目业绩、履约评价)
  • 交易记录(历史投标次数、中标次数、中标金额区间、报价规律)
  • 关联关系(股权结构、法定代表人、关键人员流动、与其他供应商的关联)
  • 信用记录(惩戒记录、诉讼记录、舆情信息)

画像不需要一步到位,但框架必须先建——后续 AI 的围串标识别、异常报价预警都要依赖这些数据。


Step 4:小范围试点——3–5 个项目,AI 初评 + 人工复核对照

试点设计 3 条铁律:

  1. 项目数量:3–5 个,覆盖不同品类和金额区间
  2. 双轨运行:AI 初评 + 人工独立评审,两者结果对照但不互通(避免 AI 输出污染人工判断)
  3. 不告知评审专家 AI 在运行——试点目的是验证 AI 的准确性和稳定性,不是验证人是否依赖 AI

试点观察指标:

指标含义达标线
AI 清标准确率AI 标记的合规问题中,人工确认有效的比例≥ 85%
评审结果一致性AI 初评与人工评审结论一致的比例≥ 75%
误报率AI 标记为问题但实际合规的比例≤ 15%
人工复核率AI 输出需要人工介入修正的比例≤ 30%
围串标识别命中AI 预警的围串标线索中,最终确认的≥ 50%

⚠️ 避坑:人工复核率 > 40%,说明模型还没调好,不要推进全量。宁可多跑 2–3 轮试点,也不要带着半成品上线——上线后每次人工复核都在消耗评审专家的耐心和信任。


Step 5:效果评估——4 个维度决定能否全量

试点结束后,从 4 个维度做系统性评估:

维度一:准确性

  • AI 清标/合规扫描的准确率是否稳定在 85% 以上?
  • 围串标识别的误报率是否控制在 15% 以下?
  • 连续 3 个项目准确率波动是否 < 5%?

维度二:覆盖率

  • 评审因素中可被 AI 处理的客观项占比是否 > 60%?(低于此值说明结构化不够)
  • 围串标 12 类特征中系统覆盖了几类?建议至少覆盖 8 类

维度三:效率提升

  • 平均评标时长是否缩短 ≥ 30%?(低于 30% 说明 AI 辅助价值有限)
  • 人工复核工时是否低于传统评审工时的 50%?

维度四:合规合规性(不是重复,是自检)

  • 红线 2(AI 不替代专家打分)是否 100% 合规?
  • 红线 8(操作留痕 6 年归档)是否 100% 落地?
  • 是否出现过”一键采纳 AI 评分”的操作?——如果有,流程设计必须修改

4 个维度全部达标,进入全量上线准备。任何 1 个维度不达标,回退到 Step 4 再跑一轮。


Step 6:全量上线——流程嵌入 + 人员培训 + 留痕制度

流程嵌入三件事:

  1. AI 辅助环节嵌入评审流程:在正式评审环节前增加”AI 合规初扫”步骤,结果作为评审参考材料分发给专家,但明确标注”AI 辅助参考,非评审结论”
  2. 人工复核节点制度化:AI 输出的每一条合规标记和风险预警,必须由指定人员逐条确认或否决,并在系统中留下复核意见
  3. 异常升级机制:AI 围串标预警触发时,自动升级至合规部门复核,不经采购部门直接处理

人员培训三件事:

  1. 评审专家培训:解读 195 号文 §3 核心条款,讲清”AI 是辅助不是替代”;实操演练”如何使用 AI 参考结果但保持独立判断”
  2. 采购岗培训:10 条红线逐条讲解,重点讲红线 2(不替代打分)、红线 5(数据不上公有云)、红线 8(留痕 6 年归档)
  3. 合规岗培训:AI 输出的审计方法——如何从操作日志还原 AI 决策链路,如何判断”是否过度依赖 AI”

留痕制度:

  • AI 工具名称、版本号
  • 输入的原始数据(脱敏后)
  • AI 输出的完整结果
  • 人工复核意见(是否采纳、理由)
  • 异常处理记录
  • 归档周期:不少于 6 年(红线 8 硬性要求)

⚠️ 避坑:没有留痕制度就上线,等于裸奔。出问题时无法举证”AI 只是辅助”,审计会默认你过度依赖 AI。


Step 7:持续优化——模型迭代 + 反馈机制 + 版本管理

AI 系统上线不是终点,是起点。持续优化 3 个动作:

动作一:模型迭代

  • 每季度用新产生的评审数据重新训练/微调模型
  • 新品类上线前必须做小范围验证
  • 模型更新后,在系统中明确标注版本号和更新内容
  • 版本管理规则:每次模型迭代都保留上一版本,可回溯至少 3 个版本

动作二:反馈机制

  • 评审专家可对 AI 输出标注”有效/无效/部分有效”
  • 采购岗可对 AI 合规扫描结果标注”准确/误报/遗漏”
  • 反馈数据自动回流至模型训练集
  • 每月汇总反馈报告,识别系统性偏差

动作三:合规复核

  • 每半年做一次合规自检——对照 10 条红线逐条复查
  • 每年请第三方做一次算法审计——重点检查算法歧视和幻觉问题
  • 195 号文 §3 中”防范模型黑箱、幻觉和算法歧视”不是一次性要求,是持续性义务

三、3 种部署模式对比

维度SaaS 模式私有化部署混合模式(推荐)
部署周期1–3 个月6–12 个月3–6 个月
前期投入低(年费制)高(硬件+软件+实施)
年度费用50–500 万元/年1000 万+(首年),后续运维 100–300 万/年200–800 万元/年
数据安全⚠️ 数据在厂商云端✅ 数据完全本地✅ 敏感数据本地,AI 能力云端
定制化程度低(标准功能)高(深度定制)中(核心定制+标准 SaaS)
合规适配依赖厂商更新自主可控敏感环节自主,通用功能跟随
适用对象中小型企业、预算有限央企/国企、涉密项目大部分中大型企业

混合模式为什么推荐?

红线 5 明确要求”招采涉密及敏感数据,禁止接入公有云大模型”。但完全私有化部署的前期投入和运维成本,绝大多数企业承受不了。混合模式的核心逻辑——敏感数据(投标文件、报价数据、供应商画像)留在本地,AI 推理能力(合规规则引擎、围串标算法模型)部署在云端——既满足数据安全合规,又降低部署门槛。

合肥”青天大模型”和中国华电”智采”系统都采用了类似架构:本地化数据存储 + 云端模型推理,通过数据脱敏和加密传输实现”数据不出域、能力上云端”。

⚠️ 避坑:选择 SaaS 模式时,必须确认厂商的数据隔离机制——你的数据是否与其他客户混用训练?如果是,即使签了保密协议,也构成红线 5 的灰色地带。


四、购物中心实战案例(脱敏)

背景:某购物中心年采购额约 8 亿元,年度招标项目约 150 个,品类覆盖工程、设备、服务三类。采购团队 12 人,无专职信息化岗。

2025 年 Q3–2026 年 Q1 部署全记录:

阶段时间关键动作结果
Step 1 选型2025.07筛选 8 家厂商,3 个维度打分,选定混合模式方案签约年费 180 万(含本地数据节点)
Step 2 合规2025.08对照 195 号文 §3 + 10 条红线逐条检查,发现 2 处不合规(“一键采纳”按钮 + 无操作留痕)厂商整改后通过,延误 3 周
Step 3 数据2025.08–10清洗 24 个月采购数据(3 人月),结构化评审因素 67 项,建供应商画像 320 份数据清洗耗时为预估的 2.5 倍
Step 4 试点2025.11–123 个项目双轨运行:清洁服务(服务类)、空调维保(设备类)、消防改造(工程类)AI 清标准确率 87%,人工复核率 28%
Step 5 评估2026.014 维度评估:准确性达标,覆盖率 72%(评审因素客观化率 65%),效率提升 35%,合规 100%全部达标,进入全量
Step 6 全量2026.02流程嵌入、全员培训(3 轮)、留痕制度上线首月 12 个项目全量运行
Step 7 优化2026.03–每月汇总反馈,Q2 第一次模型迭代误报率从 13% 降至 8%

踩过的 3 个坑:

  1. 数据清洗严重低估:预估 1.5 人月,实际 3 人月。原因是历史招标文件中大量评审因素以”自由文本”形式存在,逐条结构化极其耗时。
  2. 评审专家抵触:首批 3 个项目的评审专家中,2 位明确表示”不信任 AI”。解决方案:不强制专家看 AI 结果,但要求合规岗单独对 AI 标记的合规问题做复核——2 轮后专家发现 AI 确实能发现人工遗漏,抵触情绪缓解。
  3. 留痕制度执行难:上线首月,6 个项目中有 2 个的人工复核意见栏为空。解决方案:系统改为”人工复核意见为必填项,未填写不能进入下一步”,执行率提升至 100%。

五、5 个部署坑——别等踩了再来看

⚠️ 坑 1:直接让 AI 打主观分

表现:系统设计中有”AI 综合评分”功能,或评审专家可以”一键采纳 AI 评分”。

后果:触碰红线 2,评标违规。2025 年某省 IT 集采项目因此被廉政办调查,3 名专家被处罚,代理机构资质暂停 6 个月。

解法:系统层面删除”采纳”按钮,AI 输出只展示参考信息,专家必须在独立界面手动输入每项评分。

⚠️ 坑 2:用公开云处理涉密数据

表现:采购岗把含供应商报价、成本数据的投标文件直接上传到 ChatGPT/文心/DeepSeek 等公有云大模型做分析。

后果:触碰红线 5,数据安全违规。195 号文 §8.1 明确要求”招采涉密及敏感数据,禁止接入公有云大模型”。

解法:建立数据分级清单(绿/黄/红),红色数据严禁接入任何 AI;黄色数据仅可使用本地化部署模型。

⚠️ 坑 3:跳过试点直接全量

表现:签完约就全量上线,所有项目同时用 AI。

后果:人工复核率可能高达 50% 以上——比传统评审还慢。评审专家对 AI 输出不熟悉,每条都要反复确认,效率不升反降。某国企 2025 年 Q4 跳过试点全量上线,首月评审时长反而增加 20%。

解法:3–5 个项目试点,至少 2 轮。数据说话,不靠感觉。

⚠️ 坑 4:没有留痕制度

表现:AI 辅助评标了,但没有系统化记录 AI 输入了什么、输出了什么、人工复核了什么。

后果:触碰红线 8。审计时无法举证”AI 只是辅助”——没有留痕等于没用过。合肥《暂行办法》第四十条双向追责机制明确:不重视 AI 分析结果导致失误也有责,但前提是你能证明”我看过并做了判断”。没有留痕,你就无法证明。

解法:6 项要素全部系统化留痕,归档不少于 6 年,嵌入评审流程成为必选项而非可选项。

⚠️ 坑 5:忽视人员培训

表现:系统上线了,评审专家、采购岗、合规岗没有人接受过 AI 评标的专项培训。

后果:评审专家要么完全不看 AI 输出(浪费),要么完全依赖 AI 输出(违规)。两个极端都不行——195 号文 §3 要求的是”重视并理解 AI 分析结果,但保持独立判断”。

解法:3 轮培训——政策解读(195 号文 + 10 条红线)、实操演练(如何参考 AI 结果但独立评审)、审计应对(如何从操作日志还原 AI 决策链路)。培训不合格不得参与 AI 辅助评审项目。


六、延伸阅读