能不能让大模型直接看着数据,自己决定家里的电器几点充电、几点放电?百家乐AI的答案很明确:现阶段不能。大模型不够聪明并不是原因——真正的症结在于,"精确"和"可验证"这两个要求,恰好是大语言模型这种架构天生难以保证的。把语言模型和数值优化混为一谈,是目前"AI+能源"赛道里最容易被忽略、也最容易出问题的一步,这是一个技术判断,不是保守姿态。

大模型真正擅长的三件事

先说清楚大模型该做什么。在百家乐AI的系统里,大语言模型承担三类工作:第一是语义理解,把用户一句"晚上尽量安静一点""这周尽量省点电"这类模糊表达,转成结构化的约束条件,比如"空调运行噪音上限35分贝"或者"本周用电预算下调8%";第二是约束翻译,把这些结构化约束接入后端的优化模型,成为目标函数里的参数或边界条件;第三是结果解释,把优化算法算出来的一串数字——几点几分储能放电多少千瓦、空调功率调整到多少——转成用户能看懂的一句话,比如"今晚8点到10点电价最高,系统会用储能供电,避免多花钱"。这三件事的共同点是:都不需要"精确算出一个最优数值",需要的是语言理解和表达能力,这恰好是大模型的强项。反过来,如果把大模型的能力边界画成一张清单,会更容易看出问题出在哪:

  • 大模型擅长——理解模糊的自然语言表达,处理同一意思的不同说法,生成流畅、可读的解释文本,在多轮对话里保持上下文。
  • 大模型不擅长——保证输出数值落在给定的硬约束区间内,保证同样输入每次得到完全一致的输出,在毫秒到秒级的控制回路里稳定响应,证明一个解是全局最优而不只是"看起来合理"。

这张清单里第二组恰恰是家庭能源调度最看重的能力,这也是为什么这类任务不能直接交给语言模型。

为什么"接得上下一句话"不等于"算得出最优解"

大语言模型本质上是在做条件概率预测——给定前文,预测下一个最可能的词。这套机制在语言任务上效果很好,但用来做数值优化时会暴露一个结构性问题:它给出的数字是"看起来合理的延续",而不是"满足约束条件下的精确解"。储能调度这类问题要求的是"在电池容量、充放电功率上限、电网连接功率上限、用户舒适度下限等一组硬约束同时满足的前提下,找到成本或碳排最小的方案",这是一个典型的带约束优化问题,正确答案只有一个可行区间,容错空间很小。让大模型直接生成这类数字,风险在于它无法保证输出一定落在可行区间内——它可能算出一个让电池瞬时放电功率超过硬件上限的指令,或者让储能SOC跌破厂商建议的10%安全底线,而这些约束的违反在语言层面完全看不出破绽,指令读起来依然"合理"。

家庭能源调度是约束优化问题,不是对话问题

真正处理这类计算的,是模型预测控制(MPC)、线性规划和时序预测模型的组合。时序预测模型负责算出未来24小时的负荷曲线、光伏出力曲线和电价曲线;MPC在这些预测的基础上,每隔一段时间(比如15分钟)重新求解一次未来几小时的最优动作序列,并且只执行下一步,等新数据进来后再重新计算——这种"滚动时域"的做法能让系统持续修正预测误差,而不是一次性算完就不管了;线性规划或混合整数规划则负责在储能容量、充放电功率、设备启停等硬约束下求出全局最优解,并且能在数学上证明这个解满足所有约束条件。这套组合的核心优势是"可证明的约束满足"和"可复现"——同样的输入,一定得到同样的输出,这一点大模型目前无法保证,也是时序数据与预测模型能够支撑起精确调度的根本原因。

强化学习补的是另一块短板

MPC依赖对未来的预测,但预测总会有误差,尤其是家庭成员行为这类高度不确定的因素。这部分不确定性更适合用强化学习来处理——通过大量模拟或真实运行数据,学习一个在不确定性下依然表现稳健的调度策略,而不是每次都重新精确求解。强化学习和大模型是两类完全不同的技术:强化学习学的是"在什么状态下采取什么动作长期收益最高"的策略,大模型学的是"给定上下文,下一个词是什么"。两者都不该被单独神化成"万能方案",在百家乐AI的架构里,强化学习主要用于处理MPC覆盖不到的行为不确定性,作为预测出现明显偏差时的兜底策略——比如家庭成员临时改变作息、连续多天异常在家或不在家,这类模式很难用固定的预测模型捕捉,但强化学习可以通过持续观察调整策略权重,而不需要每次都重新建立精确的数学模型。

响应速度也是一道硬约束

除了精确性,响应速度是另一个容易被忽略的问题。电网频率波动、电价突变、设备故障保护这类信号,要求控制系统在秒级甚至更短时间内做出反应,而大语言模型的推理过程——尤其是需要多步推理、调用工具、组织语言的场景——耗时通常在一到数秒,且延迟并不稳定,遇到复杂请求可能明显变长。把这类高频控制回路交给大模型,等于把一个需要确定性响应时间的系统,建立在一个响应时间本身不确定的组件上。百家乐AI的做法是让优化算法和本地控制逻辑处理这类实时回路,大模型只在用户交互、策略解释、周期性总结这类对响应时间容忍度较高的场景里工作,两者的调用频率和时延要求完全不在一个量级上。

模拟场景:如果把决策权直接交给大模型

模拟场景:假设某家庭储能容量8度电,当前SOC为18%,已经接近厂商建议的15%安全底线。用户在App里输入"今天有点热,晚上早点把空调开足"。如果这句话直接被大模型转化为具体动作指令,模型可能基于"降温优先"的语言倾向,输出"储能立即放电支持空调满功率运行",而没有意识到SOC已经逼近安全底线,继续放电会触发电池管理系统的保护性关断,导致空调运行到一半突然失去储能支持,被迫切回电网供电,而当时正是电价高峰时段每度1.2元。在百家乐AI的实际架构里,这句话会先被大模型翻译成"提高制冷优先级"的软约束,再交给优化算法处理——算法会检测到SOC已低于安全阈值,判断此时不应继续放电,转而直接从电网取电支持空调运行,同时在App里解释"当前储能电量较低,为保护电池已优先使用电网供电,预计电价高峰结束后为储能补电"。同一句用户输入,两种架构给出的结果完全不同,差别就在于约束条件有没有被算法层强制检查。

分工不是权宜之计,是长期架构

把这套分工说成"大模型能力不够、以后会被替代"是一种误解。语言理解和数值优化是两类本质不同的计算问题,即便未来大模型能力继续提升,"生成看起来合理的答案"和"求解一个带硬约束的优化问题并证明其可行性"仍然是两件不同的事。百家乐AI不打算把这两层合并成一个模型,而是持续把两层之间的接口做得更清晰:大模型负责让系统听得懂人话、说得清道理,优化算法负责保证每一个执行到设备上的指令都经得起验证。这也是判断一套"家庭能源大模型"是否靠谱的一个具体标准——问它敢不敢公开说清楚,哪些决定是模型直接生成的,哪些是算法算出来、模型只是负责转述的。如果一套系统对这个问题含糊其辞,或者干脆宣称"都是大模型自己判断的",大概率意味着它没有认真处理过约束满足和可复现性这两个问题,用户看到的"智能"更接近一种话术包装,而不是经得起推敲的工程实现。现实里最容易出问题的,恰恰是"转述"这一步——如果转述环节漏掉了某个关键约束条件,用户听到的解释和设备实际执行的动作会悄悄对不上,这种偏差比模型直接说错一句话更难被察觉,也更难排查。