wangdafeng

企业数据结构化的五步路径

几乎所有「我们要做 AI」的项目,最后都卡在同一件事上:数据不在能被机器直接使用的形态里。这条路径有五步,跳不过去,只能一步步走。

几乎所有「我们要做 AI」的项目,最后都会卡在同一个地方:数据不在能被机器直接使用的形态里。

这不是数据质量问题,是数据形态问题。企业的业务数据大多以两种形态存在:一种是流程的副产品(审批流、工单、聊天记录),一种是给人看的报表(Excel、PPT、截图)。两者都不是给机器读的。

我通常会把结构化过程拆成五步,顺序不能颠倒。

01 业务路径数据

先把一条业务从头到尾走一遍,把它经过的每一个动作记下来:谁发起、谁审批、要几份材料、卡在哪个环节最久。

这一步的产出不是数据库表,是一张业务动作的清单。它的价值在于让后面所有工作有一个参照物——你知道自己在为哪个环节整理数据。

02 数据机制化

让数据在生产过程中就被记录,而不是事后补录。

这一步最容易被跳过,也最致命。事后补录的数据有两个天生的缺陷:一是失真,二是不可持续——一旦补录的人力撤走,数据立刻断流。机制化的关键是把「记录数据」这个动作,嵌进本来就要做的业务动作里。

03 内部数据平台

把机制化产生的数据收敛到一个地方,并且定义清楚每一张表的责任人。

这一步的技术含量最低,组织难度最高。平台建好了没人维护,三个月就变成新的数据孤岛。我倾向于在平台上线时就约定:每张表有一个名字,每个名字对应一个人。

04 面向岗位的工作流

前面三步做完,数据才第一次具备被智能体调用的条件。这一步才轮到 AI 上场:针对具体岗位,把高频动作改造成人机协作的工作流。

注意顺序——是先有结构化数据,再有智能体,不是反过来。反过来做的结果,是得到一个会胡说八道的助手。

05 自动化替代

最后一步才是自动化:把已经验证稳定的人机工作流,逐步交给系统自己跑,人只处理例外。

这一步失败的原因通常不是技术,是跳过验收。自动化上线必须有明确的回滚路径和人工兜底开关,否则一次事故就会让整个项目失去信任。

关于节奏

这五步不是瀑布式的,实际推进中会有大量往复。但顺序很重要:在第二步没完成之前做第四步,等于在沙滩上盖楼。

一个务实的判断方法:如果你的团队还在为「数据从哪来」开会,那就不该讨论模型选型。

Keep reading

订阅 RSS,新文章直接进阅读器。