夜雨聆风学习资料网

ARTICLE · 1066625

AI怎样帮人作决定?从决策智能的原理,找到企业应用的切入口

AI怎样帮人作决定?从决策智能的原理,找到企业应用的切入口

本文从工厂接单的难题切入,结合学术方法与企业实践,说明AI如何在明确目标和现实约束的基础上帮助比较方案,以及这些方案如何进入业务流程、根据执行反馈持续调整,为管理者判断哪些决策值得引入AI、怎样衡量实际效果提供参考。

星期一早上,家工厂收到客户的下单意向。客户愿意支付不错的价格,但要求一个月内交货。销售希望接下这笔订单,生产负责人担心产能不够,采购说关键原料存在延期风险,财务则提醒,提前备货会占用现金。

这时,AI给出一份预测:未来一个月,市场需求可能继续增长。

预测当然有用。可会议还得开下去:订单究竟接不接?接多少?是否加班?要不要外包?如果原料晚到一周,应该先保哪位客户?

这是一个假设场景,却包含许多企业每天面对的真实困难。我们已经能用软件看清大量数据,也越来越擅长预测。接下来如何行动,仍然需要把收益、代价、资源限制和人的反应放在一起考虑。

决策智能关注的,正是这一段工作。它尝试把选择的依据、可能后果和执行反馈连接起来,让决策能够被计算、讨论和修正。它的价值,最终要落实到交付、成本、收益和风险上。

预测之后还有一段路

决策智能的英文是Decision Intelligence,简称DI。本文把它理解为一种综合方法:利用数据、模型、业务知识和人的判断,支持或自动执行决策,再根据实际结果改进后续选择。

这个概念覆盖的范围很广。运筹优化、统计决策、因果推断和强化学习,都可以为它提供方法。企业软件又加入数据连接、业务流程和权限管理,把方法装进日常工作。理解它时,需要同时看学术方法与实际系统,不能把它等同于某一种算法。

在工厂里,数据分析可以告诉我们有多少订单、多少库存;预测模型可以估计需求和原料到货时间。但同样一份需求预测,面对不同企业,合理行动可能完全不同。

一家现金充裕、库存可以长期保存的工厂,可能愿意多备货;另一家资金紧张、产品很快过时的工厂,就要更谨慎。即使两家工厂面对相同市场,也没有一个脱离条件的统一答案。

因此,决定行动之前,需要先说清楚“什么算好”。是利润更高,交付更准时,还是现金压力更小?

企业可以设置多个目标,也可以把其中一些要求设成底线,例如不能突破预算、不能影响已承诺的关键交付。

明确目标之后,还要判断投入能带来多少额外收益。给客户分配销售资源时,仅按成交概率高低排序,未必能获得更好的回报。

一个客户本来就会购买,新增一次高层拜访未必改变结果;另一个客户恰好卡在关键协调上,同样的投入可能产生更大的增量。预测购买概率,与判断一次行动能带来多少改变,是两个不同的问题。

日常使用大模型时,我们也会让它比较方案、提供建议。这可以辅助决策。要成为可靠的业务系统,还需要明确数据是否更新、条件是否完整、方案能否执行,以及实施之后究竟发生了什么。

把问题写清楚

才能开始计算

回到那家工厂。假如负责人确定,首先要保住既有合同的交期,在此基础上争取新增利润,问题就有了较清晰的起点。

接下来,要把“接单”拆成可调整的行动:接受多少数量,分别在哪条产线上生产,采购多少原料,是否安排外包。

这些在模型里叫决策变量,意思就是我们真正能够改变的东西。

与之对应的是约束。设备每天能运行多久,工人具备哪些技能,原料何时到货,供应商是否通过认证,都是行动必须遵守的条件。

漏掉一个关键约束,计算结果就可能出现“纸面上能交货,车间里做不到”的情况。

未来需求和供货日期仍然不确定,系统可以比较不同情境:原料准时、延迟数天,需求继续增长或突然下降。

决策者由此看到,每个方案在哪些情况下表现较好,在哪些情况下损失会明显扩大。

这里通常存在真实的取舍。预计利润最高的方案,可能依赖供应商准时交货;利润稍低的方案,可能为延迟留下了余地。

随机优化、鲁棒优化等方法,分别提供不同的方式处理不确定性。它们也需要假设,无法预先容纳所有意外。

选定方案后,还要有人审批采购、更新排产和协调交期。之后,订单、库存和产线状态继续变化,原先合理的选择可能失效,需要重新计算。

OODA循环——观察、判断、决策、行动——可以帮助理解这一过程,但真正落地仍需要具体模型与业务流程。

所以,“最优方案”是一句有前提的话。它表示在给定目标、约束和模型下表现最好。模型求解得再精确,也不能弥补目标设错,或现实条件没有写进去的问题。

学术界从不同方向

接近决策

决策智能并没有一条单一的学术起源。研究者长期在研究不同的问题:人怎样选择,资源怎样分配,行动如何改变结果,以及一连串选择怎样影响未来。把这些路径放在一起,能看清不同方法各自负责什么。

信息有限时如何做选择?

决策理论提供的一种基本思路,是比较不同方案的可能结果及其价值。假如可以估计结果出现的概率,就能将收益、损失和风险偏好纳入选择。新增证据出现后,贝叶斯方法还可以帮助更新对不确定事件的判断。

但真实的人很难掌握全部选项,更不可能永远计算下去。赫伯特·西蒙提出的有限理性,将注意力放在人的信息、认知和时间限制上。

人们常常设定可以接受的标准,搜索可行选项,找到足够好的方案后停止。

这对企业系统很有启发。下午就必须答复客户时,一份及时、可行、解释清楚的方案,可能比明天才能算出的更优方案有用。

系统需要考虑计算和等待本身的成本,也需要帮助人理解取舍。

资源有限时如何安排?

运筹学把资源分配变成数学问题。以乔治·丹齐格等人的工作为代表,线性规划、整数规划等方法,使许多排产、运输和调度问题能够被系统地求解。

在工厂案例里,可以将每类产品的产量设为变量,把工时、原料和资金写成限制,再将提高利润或降低交付成本设为目标。

有些变量只能取整数,例如安排几辆车、是否启用一条产线,便需要相应的离散优化方法。

求解器会利用问题结构和算法寻找方案,某些情况下还能给出当前方案距离最优值的界限。并非所有大规模问题都能迅速求得最优解,实践中需要在计算时间和方案质量之间权衡。

这条路径的特点,是迫使人把“尽量多生产,但也别影响交付”这样的模糊要求,转成可以检查的条件。建模本身,常常就是一次业务梳理。

改变一个条件会发生什么?

假如工厂想通过降价获取订单,历史数据可能显示,降价月份的销量更高。但这并不自动证明降价带来了增长。企业也可能恰好在旺季促销,或者同步增加广告投放。

朱迪亚·珀尔的结构因果模型、唐纳德·鲁宾等人的潜在结果框架为代表的研究,关心行动究竟产生了什么影响。它们从不同形式出发,处理干预效果的定义与识别问题。

随机实验能够在适当条件下帮助区分行动效果;无法实验时,则需要结合观察数据、业务知识和明确假设。

数据中的相关性、模型画出的因果箭头,都不能单独保证结论成立。

工厂真正想知道的是:如果维持原价,订单会怎样;如果降低价格,又会怎样。这个问题直接影响定价,也决定了系统应当寻找什么证据。

今天的选择怎样影响明天?

有些决定必须连起来看。今天将全部库存用于一个订单,可能导致明天无法满足更重要的客户;今天推迟设备维护,可能增加未来停机风险。

贝尔曼的动态规划为序贯决策提供了重要基础强化学习则研究智能体如何通过与环境交互,在反馈中学习行动策略,目标通常涉及长期累计回报。理查德·萨顿和安德鲁·巴托的工作,是这一领域的重要学术线索。

这里的“策略”,可以理解为在不同状态下采取什么行动的规则,而不只是眼前的一次选择。

不过,现实工厂无法像游戏一样无限次重来。应用时需要处理试错成本、历史数据偏差,以及模拟环境和实际环境的差距。

对方也会回应时怎样判断?

市场中的其他参与者同样会作决定。工厂降价,竞争对手可能跟进;向供应商压价,也可能影响对方未来优先供货的意愿。

博弈论将这种相互依赖纳入分析。纳什均衡描述的是,在其他参与者策略保持不变时,没有人能够仅靠单方面改变策略获得更好结果的状态。

它并不保证所有人的总体利益最大,也不意味着现实市场总会到达某个均衡。

把博弈论与多智能体研究连接起来,能进一步讨论竞争、合作和机制设计。但模拟出多个角色彼此对话,只能形成一种推演;模型中‘客户’和‘对手’的反应是否符合现实,仍需要证据检验。

这些方法经常一起使用。企业可以先预测需求,通过因果分析估计促销增量,再用优化模型分配库存,并根据连续经营结果调整策略。它们解决的是不同环节的问题。

预测更准

为什么未必决策更好?

一个值得关注的交叉方向,是面向决策结果的学习,即Decision-Focused Learning。

传统流程通常先训练预测模型,尽量降低预测误差,再把预测结果交给优化系统。

但预测误差的重要程度并不相同:某种关键原料少算一点,就可能卡住整笔订单;另一种容易补货的辅料出现同样幅度的偏差,影响也许很小。

两类误差在统计指标里可能被相近地对待,进入业务之后,造成的损失却相差很大。

Adam N. Elmachtoub与Paul Grigas在《Smart “Predict, then Optimize”》中提出,将预测造成的决策误差纳入训练,利用下游优化问题的目标和约束改进预测模型。

这带来一个很具体的评价变化:除了问“预测偏差有多大”,还要问“这些预测让我们作出了什么选择”。

一个总体预测指标稍差的模型,在某些任务中仍可能带来更好的决策结果。这需要在具体问题上验证,不能推成普遍结论。

同样的方法也面临边界。训练时使用的目标若只重视短期成本,长期客户关系就可能被忽略。将模型直接对准业务结果,并不会自动解决业务目标本身的偏差。

从数学方法到企业应用

把决策方法交付给企业,可以形成不同类型的产品。有的提供计算工具,有的把数据与工作流程连接起来,还有的围绕特定设备或行业建设应用。

Gurobi、Palantir和Google DeepMind分别提供了观察这些路径的窗口;三者在这里承担的角色并不相同。

Gurobi帮助企业求解资源安排

日本时尚电商ZOZO的库存分配案例,展示了一个很容易理解的难题。新增物流中心后,各仓库既要平衡库存和作业负荷,又要尽量减少跨仓调货。如果经常一起购买的商品分布在不同仓库,同一笔订单的履约就会更麻烦。

Gurobi发布的案例,ZOZO Research利用历史订单的店铺级聚合数据建立库存分配模型,把仓库容量、入库、检验和出库能力纳入约束,并采用Gurobi求解。模型在后续物流中心建设中得到扩展和复用。

这个案例说明,企业需要知道的不只是商品卖得好不好,还包括商品放在哪里、会与哪些商品一起被购买,以及仓库能否处理对应工作量。

只有把这些条件连接起来,才有机会减少局部调整带来的整体麻烦。

Gurobi在这里提供优化求解器。业务团队或技术伙伴仍需定义目标、准备数据、建立模型,并连接执行系统。

围绕求解器的商业价值,在于计算性能、稳定性、开发接口与技术支持,不能将一家客户的完整项目都归功于单个软件组件。

Palantir 把业务对象与行动连接起来

Palantir的路径更接近企业运营平台。按照其官方文档,Foundry提供数据运营能力,Ontology把数据和模型映射到工厂、设备、产品、订单等业务对象,并结合对象关系、动作、函数与权限支持工作流程;AIP则在这套基础上建设AI工作流、智能体和应用。

用开篇的假设工厂来理解:采购系统中的一条“原料延期”记录,需要关联到具体供应商、原料批次、生产任务和客户订单。

负责人才能看到受影响范围,比较调整方案,并将批准后的动作送入相应系统。

这里的假设过程用于解释产品架构,并不代表某个客户已经实现相同效果。真正部署时,还要逐一解决数据口径、业务逻辑和系统连接问题。

例如,“修改交货日期”看似只是改一个字段,实际上可能同时影响客户承诺、生产排程与合同责任。

谁能够提出修改,谁能够批准,哪些下游系统需要同步,都属于决策系统的一部分。

大模型可以帮助人理解问题、查找数据、生成候选方案和调用工具。

涉及排产求解时,可以调用专用模型;涉及写入系统时,则要遵守预先定义的动作和权限。语言交互让软件更容易使用,可靠运行仍依赖这些具体安排。

从这一路径看,企业平台的价值往往体现在持续使用中:一个业务对象被定义清楚,一套决策流程能够复用,新的应用就不必每次重新梳理全部关系。当然,这也意味着较重的实施和组织协作工作。

DeepMind 让决策进入持续控制

Google与DeepMind的数据中心冷却项目,展示了另一类实践。根据2018年的官方披露,系统已从向人员推荐操作,发展到在操作人员监督下直接控制冷却设备。

系统每五分钟读取传感器状态,预测不同动作组合对未来能耗的影响,在安全约束内选择动作,再由本地控制系统核验后执行。工作人员可以退出AI控制,切回既有控制方式。

这个案例发生在大模型广泛进入企业之前。

它说明,自动决策可以围绕一个明确的物理过程建立:状态能够观测,动作可以实施,结果不断返回。

从建议走向控制,变化也很具体。建议可以等工程师理解后操作,自动控制需要处理信号异常、动作越界和系统失效。

选择是否执行、什么时候退回原有模式,本身就是系统必须预先安排的决定。

这里的DeepMind代表Google内部应用与研究合作,不能直接当作对外销售的通用决策软件案例。它的参考意义,是展示一个受约束的决策闭环如何进入连续运行的业务过程。

算出来以后,还有组织这一关

三个例子展示了决策智能进入企业的不同方式:使用优化求解工具、搭建运营平台,或围绕具体业务过程建设专用系统。

对于采购者,最有用的起点仍然是一项具体工作:谁在什么时间,依据什么信息,作出什么决定?

有些困难来自目标冲突。销售按收入考核,生产希望减少排程变化,财务要求控制库存。

如果这些部门各自优化自己的指标,系统可能只会更快地暴露争议。哪些目标优先,哪些损失可以接受,仍需要管理者协调。

另一些困难来自业务信息不完整。库存表里显示有货,但货物可能已经被口头预留;设备系统显示可用,但现场负责人知道它近期不稳定。

系统要想获得信任,需要有渠道纳入并及时更新这些现场信息。

投入是否划算,也不能只看一次演示。决策发生得是否足够频繁、错误代价是否足够高、数据能否获得、改善能否衡量,都会影响商业价值。

常规补货通常比一次性的战略并购更容易积累可比较的反馈,但两者都可能需要决策支持。

效果评价尤其重要。系统上线后,销量增长了,可能是市场回暖;库存下降了,也可能同时损失了一部分订单。

在条件允许时,可以设置对照试点,或在分阶段上线时保留可比较的业务范围,将新方法与原有规则比较,并留意市场变化等因素的影响。历史回放可以帮助发现问题,却不能完整重现另一种行动本来会带来的结果。

对供应商而言,可复用性则影响生意能做多大。

每新增一个客户,都要重新定义全部业务逻辑,交付会很依赖专家;如果能把部分模型、连接方式和工作流程沉淀下来,后续实施才有机会变得更轻。

求解器提供计算能力,企业平台连接数据与流程,行业软件承载具体业务,实施服务则负责将这些能力接入企业现有系统。

最后的决定,仍要回到现场

现在再看那场工厂会议。一个有帮助的系统,应当让负责人看到:新订单会占用哪些产能,哪批原料存在风险,各方案对利润和交付有什么影响,以及什么变化会触发重新安排。

它也应当能够说清楚结论的条件。比如,当前方案依赖某批原料周三到货;如果周三没有到,需要转用哪个备选安排。

这样的条件越具体,人越容易检查,也越容易在现实变化时及时修正。

最终,负责人可能只接下部分订单,保留一段产能余量,并要求采购在两天内确认供货。这个决定未必看上去激进,却可以有清楚的依据和后续动作。

到星期三,供应商的答复来了。系统需要做的,是把这条新信息放回原来的判断,看看计划是否还成立。决策智能有没有价值,就在这样的时刻接受检验。

资料引用:

[1] 清华大学交叉信息研究院 Decision Intelligence Lab 官方介绍。 

[2] Herbert A. Simon. Administrative Behavior,1947;A Behavioral Model of Rational Choice,The Quarterly Journal of Economics,1955,69(1),99—118。有限理性与满意化的经典文献。

[3] Stephen Boyd、Lieven Vandenberghe. Convex Optimization,Cambridge University Press,2004。

[4] Judea Pearl. Causal Inference in Statistics An Overview,Statistics Surveys,2009,3,96—146。

[5] Richard S. Sutton、Andrew G. Barto. Reinforcement Learning An Introduction,第二版,MIT Press,2018。 

[6] John F. Nash. Equilibrium Points in N-Person Games,Proceedings of the National Academy of Sciences,1950,36(1),48—49。

[7] Adam N. Elmachtoub、Paul Grigas. Smart “Predict, then Optimize”,Management Science,2022,68(1),9—26;预印本始于2017年。 

[8] Gurobi. ZOZO Research Optimizing Inventory Allocation for Scalable E-Commerce Logistics,官方客户案例,2026年8月发布,涉及2020年、2023年的物流中心建设实践。 

[9] Palantir. Ontology building,官方技术文档。 

[10] Palantir. AIP overview,官方技术文档。 

[11] Chris Gamble、Jim Gao. Safety-first AI for autonomous data centre cooling and industrial control,Google DeepMind,2018年8月17日。 

相关学习资料