从 Demo 到生产:企业级 AI 必须补齐的四大工程护栏与状态机控制
核心观点:演示展示可能性,生产承担实际失败的代价。大模型是一个带有不确定性的概率组件,系统必须围绕它构筑确定性的流程、校验、观测和人工协同护栏,才能把单次效果转化为可持续的生产力。
📌 执行摘要与对照清单
| 维度 | Demo / 原型阶段 | 生产级落地阶段 (Production-ready) |
|---|---|---|
| 数据纯净度 | 5 份精心清洗的 Markdown / PDF | 跨页扫描件、合并单元格、批注合同、错别字与业务黑话 |
| 流程控制权 | 完全交给 LLM 自主循环 (ReAct / Zero-shot) | 确定性状态机 (Finite State Machine) 约束核心主干 |
| 检索召回率 | 单一向量余弦相似度检索 | 关键词 + 密集向量 + 元数据过滤 + Cross-Encoder 语义重排 |
| 并发与容错 | 单人串行提问,响应 15 秒无人介意 | 排队、限流、流式输出、熔断降级与敏感操作人工审批 |
| 错误代价 | 重新点击一次“Regenerate” | 引爆海关罚金、广告法处罚或核心采购底价外泄 |
一、演示展示可能性,生产承担实际失败的代价
很多 AI 创业团队或内部创新组喜欢用几份精心挑选的 PDF 文档做一个惊艳的高管演示。提问清楚、数据干净,大模型回答得头头是道。然而,一旦把系统推给一线员工,系统便会在几天内迅速失控:
- 输入极其脏乱:业务人员不会按套路提问,错别字、简称缩写、多重诉求、含糊表述层出不穷;
- 文档结构复杂:实际生产中的合同有手写批注、报价单有跨页合并单元格、技术图纸有矢量线条,通用 Parser 一切片全部分崩离析;
- 延迟与并发雪崩:多次模型调用、向量检索、外挂 API 串联,端到端耗时突破 30 秒,员工疯狂点击刷新,直接打爆 API 额度与 GPU 显存。
从 Demo 走向生产,增加的不仅是请求数量,更是权限边界、故障恢复和持续治理的责任。
二、不把业务控制权全权交给模型:状态机与网关解耦
1. 为什么“完全自主 Agent”在企业生产中是灾难?
过于抽象的自主 Agent 框架(让 LLM 自行决定每一步调用什么工具、是否结束)在生产环境中极度脆弱:
- 经常陷入无休止的死循环重试;
- 工具入参漂移,导致下游数据库写入错误格式;
- 难以进行精准的性能瓶颈排查与回归测试。
2. 确定性状态机(FSM)收拢主干
成熟的 FDE 团队会将关键业务流程组织为确定性状态机,模型仅在特定节点承担受约束的抽取、总结或分类任务:
[用户输入]
│
▼
[前置校验与鉴权] ──(参数缺失/无权限)──> [即时阻断/澄清提示]
│
▼
[意图识别与路由]
│
├── 简单查询 ──> [确定性 SQL / 本地规则库] ──> [秒级直接返回]
│
└── 复杂任务 ──> [状态机受控步进]
├─ Step 1: 确定性数据抽取 (Pydantic 强校验)
├─ Step 2: 向量与知识三路召回
├─ Step 3: LLM 业务生成与引用对齐
└─ Step 4: 平台政策与广告法合规过滤
│
▼
[高危操作拦截?] ──(是)──> [推送飞书/企微审批卡]
│ (否)
▼
[最终结果流式返回 + Chronicle 审计日志入库]
3. 工具接口与网关标准化
- 入参强类型契约:使用 JSON Schema 或 Pydantic 定义工具输入,严格校验必填字段,缺失时立即回退澄清,决不让脏数据穿透到底层 ERP/CRM;
- 操作审计与熔断:涉及资金、调价、批量更新等 Tier 3 高危动作,必须接入外部审批工作流,保留操作快照与审批人 ID。
三、检索三问:找得到、看得懂、有权限
企业落地 RAG(检索增强生成)最常踩的三大坑:
- 型号编号混淆:搜索
Model-A200,向量检索因余弦距离相近召回了Model-A210,导致参数完全对不上; - 越权访问泄露:普通员工查询报销标准,系统意外检索到了总监级的薪酬与期权激励方案;
- 机械切片粉碎:固定 500 字符切片,恰好将表格的表头与数值切断,模型根本读不懂数字的物理含义。
解决方案:三路混合召回与权限前置过滤
- 第一步:基于组织架构的权限前置过滤(Metadata Filtering)
绝不能指望在 Prompt 里“提醒模型不要告诉用户保密内容”。必须在向量库检索前,根据用户的工号与角色直接在元数据层做 SQL 式过滤,从源头剔除越权文档。 - 第二步:BM25 关键词 + 密集向量(Dense Vector)混合召回
用 BM25 保障产品型号、专有名词、错误码的 100% 精确命中;用向量语义理解用户的口语化泛化表达。 - 第三步:Cross-Encoder 语义重排(Rerank)
将初筛出的 Top 20-30 个候选切片送入重排模型,精准打分并保留真正有信息密度的 Top 3-5 个段落,大幅降低 LLM 上下文噪音。
四、生产观测与持续迭代机制
生产系统的生命力在于上线之后:
- Bad Case 标注与回归流:员工每一次点击【踩】或手动修改,系统自动将原 Query、模型输出与最终人工修正句打包存入测试集,作为版本升级的必测用例;
- 分级告警:对模型响应超时、幻觉拦截率异常升高、API 报错率建立秒级监控看板;
- 全量链路追溯:每个回答附带 TraceID,可一键复原当次检索命中的具体段落、提示词快照与模型原始 Token 消耗。
把不确定的模型关进确定性的工程笼子里,企业 AI 才算真正落地。