共赢街亭(五):专家智慧汇流三步骤
一、前言
当今,各企业逐渐踏入AI Agent的热潮中,其中逐渐浮现出Agent决策质量所面临的瓶颈,就是:在高风险决策场景中,知识没有被精致分层、校准和结构化;导致Agent常从单一数据源学习,容易继承单一观点的偏误。
于是,就依照Agent学习流程的步骤:FSM(状态机) à KG(知识图) à SFT(监督式微调),逐层地汇集不同类型专家的智慧。来把战场动态和评估经验、系统结构与战略原则形成一条完整的学习管线。
二、专家智慧汇流三步骤
在本文里,将专家智慧汇入Agent的过程分为三个步骤。每一步骤处理不同层次的知识,并对应不同的工程产物。兹说明这些步骤,如下:
l 步骤-1:战术专家FSM融合,表达第一线战场状态转移的评估智慧。
l 步骤-2:将融合FSM映像成KG,并加入战略专家与系统设计的知识。这些战略专家知道任务目标、全局优先序与不可违反的原则;而系统设计专家知道关键依赖、脆弱点、风险节点与安全约束,
l 步骤-3:邀请更多专家参与SFT、进行分类标注与评估,优化Agent学习环境。
其中,FSM融合让Agent看见多种可能、KG融合让Agent理解因果结构、而SFT融合让Agent通过专家检验。这成为一条步骤分明、可追踪、可检查、可迭代的专家智慧汇流管线。
步骤 | 汇集的专家智慧 | 主要知识形式 | 对Agent的价值 |
步骤-1:战术专家FSM融合 | 第一线战术专家、现场操作专家 | 机率性FSM:状态、事件、转移、机率 | 看见突发后的多种可能路径,降低单一专家偏误 |
步骤-2:专略专家KG | 战略专家、系统设计专家 | KG节点与关系:因果、依赖、约束、目标 | 理解为何会变、哪些因素造成风险、哪些原则不能违反 |
步骤-3:更多专家参与SFT | 治理者、审查者、使用者代表、教学专家 | SFT数据、分类标注、评估题、评分规准 | 校准输出行为,检查是否真正学会并能稳定应用 |
这三个阶段是彼此连接,而其前后互补。状态机(FSM)是第一线专家智能的动态模型。知识图(KG)是多专家智能的显性结构。而SFT(监督式微调)是更多专家共同检查Agent是否能正确使用这些知识的质量关卡。
三、步骤-1:战术专家FSM融合
此步骤的目标是:收集第一线专家脑中的「系统会怎么变」。这类知识最适合用FSM来表达,因为FSM能清楚描述状态、事件与状态转移。当系统面对突发冲击时,单一专家的FSM往往会带有偏误,因此需要融合多位前线专家的FSM。
例如街亭案例里,马谡与王平都是面对战场的第一线指挥官。马谡可能看见高地优势与击退敌军的机会;王平则更敏感于水源、补给、军心与失守风险。若只用马谡FSM训练Agent,Agent可能过度乐观;若只用王平FSM训练Agent,Agent可能较保守。将两者融合成机率性FSM,则能让Agent同时看见机会与风险。
马谡与王平两位专家FSM融合,可以让Agent学会在多个专家模型之间进行风险权衡,而不偏颇于模仿某一位专家。例如,汇集马谡和王平两位第一线专家对状态、事件、转移路径与机率的判断。接着,对齐状态与事件,合并转移规则,保留不同路径的机率与风险。然后,得到一个融合后的机率性FSM,作为Agent学习的动态世界模型。
四、步骤-2:战略专家KG
此步骤的任务是:把融合FSM映射成KG,并进一步加入战略专家的知识。FSM擅长描述:怎么转移。但KG更适合表达:为什么这样转移、哪些因素互相依赖、哪些约束必须遵守、什么是高阶战略目标。
例如,在街亭案例中,将融合FSM映像成KG后,这KG已经内含马谡与王平两位前线专家的状态转移智慧。若再加入孔明的战略智慧,例如:<要道扎营>战略节点。还可以添加街亭系统设计专家的知识节点,例如:水源、补给、地形、通路、军心等结构节点和依赖关系。
专家类型 | 贡献内容 | 进入KG的形式 |
前线战术专家 | 突发事件后状态转移、机率、风险路径 | 由融合FSM映射成fsm_state、event、transition边 |
战略专家 | 任务目标、全局优先序、不可违反的原则 | 战略kg_node、目标节点、约束关系 |
系统设计专家 | 关键资源、依赖、脆弱点、安全约束 | 工程节点、因果关系、风险控制节点 |
于是,这个融合KG就成为一个多专家知识结构。它同时包含前线战术智能、系统设计智能与高阶战略智能。
五、步骤-3:更多专家参与SFT
此步骤的任务是:邀请更多专家参与SFT数据设计、偏好标注、模拟考题、评分规准与错误诊断。其目的是检查Agent是否能正确理解并运用KG中的专家智慧。这里的KG就像<教科书>,而SFT则如同<模拟考试>。若只有教科书,而没有模拟考,就可能不知道Agent是否真的学会。反之,若只有模拟考,则Agent可能只在被测验时接触标准,缺乏完整的因果结构与战略理解。 SFT(监督式微调),顾名思义,可知需要如下动作:
· 收集SFT资料:将专家智慧转成可学习的情境、问答、推理链与示范决策。
· 进行分类标注:由专家比较多个Agent输出,标示何者更符合战略与风险控制。
· 提供错误回馈:当Agent答错时,回头修正KG、FSM、SFT数据或奖励设计。
六、观摩一个情境:小狮子的故事
据说一只小狮子,跟随妈妈住在一个草原旁的草欉里。小狮子肚子饿了(状态)就采取行动:冲去草原抓兔子,填饱了。
由于小狮子贪婪而持续,久而久之,免子很敏感,小狮子愈追兔子跑愈快,逐渐地小狮子追不到兔子,就饿倒了。 此时,小狮子的妈妈(专家)就说:我小时候,肚子饿了,就躲在家里假装睡大觉,就OK了。于是,小狮子就把妈妈(专家)的这项宝贵知识,注入脑海里。
当小狮子肚子又饿了,就会参考妈妈的智慧,而躲在草丛里假装睡大觉。果然听到兔子的声音愈来愈近,等到很靠近了,随意就抓到兔子吃饱了。从此,小狮子学到最佳策略:<眼睛瞇瞇就有饭吃>!
这个小狮子案例与街亭案例,是非常一致的,都可以采取前面各节所述的三步骤专家知识汇流模式。这个模式可以跨案例迁移,街亭案例说明战场决策,而小狮子案例说明其贪婪策略导致饿倒在地。这两者背后可共享同一个模式。
案例 | 步骤-1:FSM融合 | 步骤-2:扩充KG | 步骤-3:SFT/评估 |
街亭 | 马谡FSM + 王平FSM,融合成机率性街亭FSM | 加入系统设计专家与孔明战略节点:要道扎营 | 邀请刘备、孔明等专家评估Agent是否顾全大局 |
小狮子 | 小狮子FSM + 兔子FSM,形成草原互动组合FSM | 加入妈妈专家智慧节点:眼睛眯眯就有饭吃 | 邀请狮群长者、生态专家、教学专家评估策略是否稳健 |
这两个案例是非常一致的,例如从街亭案例中可以看到:没听孔明的战略,就失街亭。而从小狮子案例可以看到:没听妈妈的战略,就饿倒了。于是,第一线FSM可以让Agent看见现场状态如何转移,而战略KG节点则能告诉Agent整体应该往哪里走。
七、结语
本文所述的专家智慧汇流三步骤,是把专家智慧转化为Agent可学习、可推理、可验证的决策能力,能大幅提升Agent决策质量。其核心价值,在于它把<专家知道什么>转化为<Agent能学什么、推理什么、接受什么检验>。
首先,透过双专家FSM融合,让Agent看见多种可能的状态转移。接着,透过多专家融合KG,让Agent理解因果、依赖、约束与战略。然后,透过更多专家SFT与评估,让错误能被回馈到FSM、KG与训练数据中,因而建立了人机之间的双养循环。
在下一期,将实际对KG添加孔明的<要道扎营>战略节点,并观察其如何提升Agent的学习效果。


评论