从 Demo 到生产:企业级 AI 必须补齐的四大工程护栏与状态机控制

核心观点:演示展示可能性,生产承担实际失败的代价。大模型是一个带有不确定性的概率组件,系统必须围绕它构筑确定性的流程、校验、观测和人工协同护栏,才能把单次效果转化为可持续的生产力。


📌 执行摘要与对照清单

维度Demo / 原型阶段生产级落地阶段 (Production-ready)
数据纯净度5 份精心清洗的 Markdown / PDF跨页扫描件、合并单元格、批注合同、错别字与业务黑话
流程控制权完全交给 LLM 自主循环 (ReAct / Zero-shot)确定性状态机 (Finite State Machine) 约束核心主干
检索召回率单一向量余弦相似度检索关键词 + 密集向量 + 元数据过滤 + Cross-Encoder 语义重排
并发与容错单人串行提问,响应 15 秒无人介意排队、限流、流式输出、熔断降级与敏感操作人工审批
错误代价重新点击一次“Regenerate”引爆海关罚金、广告法处罚或核心采购底价外泄

一、演示展示可能性,生产承担实际失败的代价

很多 AI 创业团队或内部创新组喜欢用几份精心挑选的 PDF 文档做一个惊艳的高管演示。提问清楚、数据干净,大模型回答得头头是道。然而,一旦把系统推给一线员工,系统便会在几天内迅速失控:

  1. 输入极其脏乱:业务人员不会按套路提问,错别字、简称缩写、多重诉求、含糊表述层出不穷;
  2. 文档结构复杂:实际生产中的合同有手写批注、报价单有跨页合并单元格、技术图纸有矢量线条,通用 Parser 一切片全部分崩离析;
  3. 延迟与并发雪崩:多次模型调用、向量检索、外挂 API 串联,端到端耗时突破 30 秒,员工疯狂点击刷新,直接打爆 API 额度与 GPU 显存。

从 Demo 走向生产,增加的不仅是请求数量,更是权限边界、故障恢复和持续治理的责任。


二、不把业务控制权全权交给模型:状态机与网关解耦

1. 为什么“完全自主 Agent”在企业生产中是灾难?

过于抽象的自主 Agent 框架(让 LLM 自行决定每一步调用什么工具、是否结束)在生产环境中极度脆弱:

2. 确定性状态机(FSM)收拢主干

成熟的 FDE 团队会将关键业务流程组织为确定性状态机,模型仅在特定节点承担受约束的抽取、总结或分类任务:

[用户输入] 
   │
   ▼
[前置校验与鉴权] ──(参数缺失/无权限)──> [即时阻断/澄清提示]
   │
   ▼
[意图识别与路由]
   │
   ├── 简单查询 ──> [确定性 SQL / 本地规则库] ──> [秒级直接返回]
   │
   └── 复杂任务 ──> [状态机受控步进]
                      ├─ Step 1: 确定性数据抽取 (Pydantic 强校验)
                      ├─ Step 2: 向量与知识三路召回
                      ├─ Step 3: LLM 业务生成与引用对齐
                      └─ Step 4: 平台政策与广告法合规过滤
                           │
                           ▼
                  [高危操作拦截?] ──(是)──> [推送飞书/企微审批卡]
                           │ (否)
                           ▼
                  [最终结果流式返回 + Chronicle 审计日志入库]

3. 工具接口与网关标准化


三、检索三问:找得到、看得懂、有权限

企业落地 RAG(检索增强生成)最常踩的三大坑:

  1. 型号编号混淆:搜索 Model-A200,向量检索因余弦距离相近召回了 Model-A210,导致参数完全对不上;
  2. 越权访问泄露:普通员工查询报销标准,系统意外检索到了总监级的薪酬与期权激励方案;
  3. 机械切片粉碎:固定 500 字符切片,恰好将表格的表头与数值切断,模型根本读不懂数字的物理含义。

解决方案:三路混合召回与权限前置过滤


四、生产观测与持续迭代机制

生产系统的生命力在于上线之后:

把不确定的模型关进确定性的工程笼子里,企业 AI 才算真正落地。