构建实用 AI 系统:从模型想法到真实工作流

2026年9月01日 4 min read

模型不是产品。它只是一个系统组件。这个系统必须接收不完美的输入,在不确定性下做决定,并留下可以被检查的证据。

从文档智能、计算机视觉、边缘翻译和 AI 工作流自动化的公开案例中,可以反复看到同一个工程教训:工作流和模型同样重要。

从工作流开始

在选择模型之前,先定义流程:

输入 -> 分类 -> 路由 -> 推理 -> 验证 -> 审核 -> 修复 -> 导出

这样可以让失败变得可见。低置信度的 OCR 结果可以转到第二个 provider;视觉预测可以用几何规则或业务规则检查;agent 只有在状态机允许时才调用工具。

路由是产品决策

不同输入需要不同路径。清晰的发票、手机拍摄的表格和损坏的扫描件,不一定应该使用相同的 OCR 配置。路由可以考虑文档类型、语言、置信度、延迟预算和成本。

AI agent 也一样。小模型可以处理分类,更强的 reasoning model 处理模糊案例。这通常比把所有请求都发送给最大模型更便宜、更容易运维。

验证比盲目信心更重要

模型分数不是证明。实际系统需要必填字段、范围、schema、字段间一致性、重复检测和领域规则。输出还应该携带 provenance:使用了哪个模型和版本、调用了哪些工具、哪些字段经过审核。

人类审核不是失败

Human review 是一种控制面。它应当是有选择的、可解释的并且容易完成。审核者需要看到原始证据、抽取值、不确定性信号和修正入口。修正结果只有在完成标注和治理后,才应成为训练或评估数据。

衡量整个系统

单看 accuracy 会隐藏重要 trade-off。还应衡量任务成功率、拒答质量、延迟、成本、重试率、审核负担和恢复时间。一个稍微不那么准确、但可预测且可修复的系统,可能比一个遇到隐性失败的 benchmark 冠军更有价值。

实用规则很简单:选择能够安全完成工作流的最小系统,再根据证据显示的瓶颈改进模型。AI engineering 不只是模型选择,而是设计一个能够工作、失败、解释自己并恢复的循环。

New posts, shipping stories, and nerdy links straight to your inbox.

2x per month, pure signal, zero fluff.


分享这篇文章: