概述
六周变六小时:一个营销组合模型的案例
品牌团队盯着一张媒体投放表格发呆。通用 AI 聊天机器人建议他们把 30% 预算挪到 TikTok。理由呢?"数据表明如此。"没有置信区间,没有反事实分析,没有因果推断:只是一个听起来合理的猜测。
"AI 说是这样"和"我敢拿预算赌这个结论"之间的鸿沟,正是 Decision.AI 试图填补的。它是一个开源的 agentic data science 平台,其智能体建立在贝叶斯因果模型之上,而非仅靠大语言模型提示。每个输出都附带可信区间,让你知道模型知道什么、不知道什么。
Decision.AI 由 PyMC Labs 构建,这家公司同时也是 PyMC 的创造者。PyMC 是一个拥有超过 10,000 GitHub 星标和 110 万次下载量的贝叶斯建模库。该平台以 Decision Lab 之名于 2026 年 4 月开源,通过名为 Daimon 的中央调度器协调六个组件运行:Deep Research Agent 负责自主数据科学工作流,MMM Agent 负责贝叶斯媒体组合建模,Decision-Hub 是 CLI 管理层,另有可移植的 Agent Skills 和用于基准测试的 Decision Gym。该平台官网上的一则客户证言称其团队将贝叶斯 MMM 建模时间从六周压缩到了六小时(厂商声称,未经独立核实)。
通用 AI 智能体为何在此失灵
多数 AI 智能体不过是 LLM 的薄封装。让它们分析数据时,产出的是统计上幼稚的答案:相关性被包装成因果发现,没有不确定性边界,没有模型诊断。PyMC Labs 的技术博客将故障模式归纳为三类。其一,智能体缺乏领域约束,会毫无顾忌地套用错误的统计检验。其二,跳过测量验证,对输出照单全收。其三,无法表达"不知道",产出的是自信的胡话而非诚实的不确定性区间。
Decision.AI 逐条应对。Skills 将领域约束编码为可执行护栏,使分析营销数据的智能体不会错误地用 t 检验替代分层贝叶斯模型。分层测量通过 Decision Gym 的基准测试验证每个分析步骤,确保结果到达用户前已经过校验。贝叶斯后验分布配可信区间将不确定性显式呈现:输出不是"多投 TikTok",而是"后验表明,将 30% 预算重新分配有 0.7 概率提升 ROI,90% 可信区间为 12% 至 48% 的提升"。
架构上做到了关注点分离。LLM 负责推理层:模型选择、结果解读、自然语言解释。PyMC 负责统计层:推断、不确定性量化、后验诊断。这种双层设计将其与 Chat4Data 或 Manus 等通用智能体区分开来,后者的单一 LLM 同时承担推理与数值计算。
技术栈与团队背景
底层是 PyMC,这个概率编程库在过去十余年里一直是 Python 贝叶斯建模的事实标准。Decision.AI 的智能体以编程方式构建、拟合和验证 PyMC 模型,再由 LLM 推理模型选择与结果解读。统计计算的重活留在 PyMC,不在语言模型。
PyMC Labs 于 2021 年以贝叶斯咨询公司的身份起步,由 Thomas Wiecki 在离开量化交易平台 Quantopian(曾任 VP of Data Science)之后创立。据 Wiecki 当年的创立公告,团队包括神经科学博士、数学家,以及至少一位前 SpaceX 工程师。Decision.AI 是多年企业咨询经验的产物化。平台完全免费且开源(MIT 许可),收入来自企业培训、咨询和企业支持,均不触及核心产品。
优势与局限
优势方面,每个输出都带可信区间。代码 MIT 许可,完全可审查:没有黑箱,没有厂商锁定。MMM Agent 解决的是营销分析领域真实且昂贵的问题,贝叶斯方法在这个场景下确实优于黑箱归因模型。Decision Gym 提供标准化的智能体评估,这在 agentic AI 领域罕见,对企业采购尤为重要。
需留意的地方:平台于 2026 年 4 月刚开源,仍处早期阶段。Agent Skills 生态尚小,特定领域的开箱即用覆盖面有限。缺乏统计训练的用户可能误读可信区间或先验分布。PyMC Labs 提供付费课程来弥合这一差距,保持核心平台免费。截至 2026 年 7 月尚无托管 SaaS 版本,部署方式为 CLI 或自托管,对非技术团队有一定门槛。
定价:免费且开源。 所有组件 MIT 许可,GitHub 可获取。PyMC Labs 通过企业培训、咨询和企业支持盈利。(价格核查于 2026 年 7 月。)