如果把"家庭能源大模型"想象成一个装了很多知识、能聊天的AI,那它在真实调度里几乎什么都做不了。一条"现在要不要给电动车充电"的建议,背后至少需要六类数据在同一时刻对齐:天气预报、实时电价、历史负荷曲线、光伏出力、储能与设备状态、家庭成员的活动模式。少一类,模型给出的答案可能语法通顺,但数字是错的。百家乐AI在家庭侧最先做的事,是把这六类数据的时间轴对齐,再交给不同的模型分别处理——"理解语言"这件事,其实排在后面。这也是为什么"家庭能源大模型"这个说法容易让人误解——真正在后台运转的,是一整套数据管线,而不是单独一个会说话的模型。

六类数据,六种更新节奏

家庭能源系统里的数据并不是一份统一的表格,而是六条节奏完全不同的时间线。天气预报数据通常每小时更新一次,未来24到72小时的云量、气温、辐照度决定了光伏出力预测的上限。实时电价在分时电价地区一天只切换几个时段,但在部分试点动态电价地区可能15分钟刷新一次。历史负荷曲线是按天、按周、按季节滚动积累的,用来学习"这个家庭周三晚上大概率会用多少电"。光伏出力数据来自逆变器,通常5到15分钟采集一次。储能和电动车的电池状态——电压、电流、荷电状态(SOC)——变化更快,往往按秒或按分钟刷新。家庭活动模式,比如有没有人在家、厨房有没有开火、卧室灯有没有亮,来自门磁、人体传感器和用电特征识别,属于事件驱动,没有固定周期。

这六类数据如果不做时间对齐,会出现一种很隐蔽的错误:模型看到的"当前状态"其实是几个不同时刻的拼接。比如电价数据是15分钟前的,储能SOC是30秒前的,天气预报是1小时前的,三者拼在一起送进模型,得到的调度建议看起来合理,实际执行时机已经偏移。百家乐AI在数据层专门做了一层时间戳重采样(resampling)和插值处理,把所有输入统一对齐到同一个决策时间窗口,这一步不涉及"智能",纯粹是工程问题,但决定了后面所有判断是否成立。

冷启动问题:一个刚安装系统的家庭,数据从哪里来

历史负荷曲线是六类数据里积累最慢的一类,也是最容易被忽视的一类。一个家庭要形成"周三晚上大概率用多少电"这种规律性判断,至少需要覆盖一整年四季的用电记录,因为夏天空调负荷和冬天采暖负荷的结构完全不同,光靠一两个月数据会把季节性波动误判成异常。这就带来一个现实问题:刚安装系统的家庭没有历史数据,模型该怎么给建议?百家乐AI在这个阶段采用的是"相似家庭画像"过渡方案——根据房屋面积、常住人口、是否有电动车和储能、所在地区气候带,先匹配一组结构相似的匿名家庭的负荷模式作为初始参数,同时明确告知用户这一阶段的建议置信度较低,调度会偏保守,比如不会激进地把储能放到很低的SOC去博一个价差。随着真实用电数据积累到三到六个月,系统再逐步用这个家庭自己的数据替换掉初始画像,调度才会变得更贴近这个家庭的真实习惯。这个过渡期本身也是数据问题,而不是算法问题。

数据颗粒度不够,模型会"预测对了却调度错了"

很多人以为数据只要"有"就行,但颗粒度不够会导致一种反直觉的结果:单点预测是准的,调度却是错的。举例来说,如果光伏出力预测只精确到"今天发电量合计18度",模型没法判断这18度是集中在中午11点到1点,还是分散在全天。但储能的充放策略、洗碗机和洗衣机的启动时间,都依赖"什么时候发"而不是"发多少"。同样,负荷预测如果只精确到"今天用电25度",而不知道晚高峰6点到8点大概率占其中40%,模型就没法提前决定是否在高峰前把储能充满。百家乐AI要求光伏、负荷两类核心时序数据至少精确到15分钟颗粒度,这也是行业里做家庭级能源调度的普遍下限——低于这个颗粒度,模型能算出的只是"大概方向",不是可执行的动作。

模拟场景:一条数据缺失,调度建议整体偏移

模拟场景:某三口之家,储能容量10度电,当前SOC为35%。系统预测明天上午9点到下午3点为晴天,光伏预计发电22度;实时电价显示今晚8点到10点为高峰时段,每度1.2元,凌晨0点到6点为谷时段,每度0.35元。按照正常数据链路,百家乐AI会建议:晚高峰期间储能放电支撑家庭用电,避免从电网买高价电;等到凌晨谷时段,再用电网低价电把储能补到80%,为明天上午的负荷缓冲留出空间,因为光伏要到9点后才明显出力。但假设当晚天气预报接口出现1小时延迟,模型拿到的还是前一天"多云、光伏预计12度"的旧数据,系统就可能判断"明天光伏不足,今晚应该少放电、多保留储能",结果晚高峰仍然从电网买了部分高价电,实际却在浪费保留下来的储能容量——因为第二天其实是晴天,光伏完全够用。这个场景说明:数据链路里任何一环延迟或缺失,模型即使算法本身没有问题,输出的建议也会系统性偏移,而且这种错误很难通过"换一个更大的模型"解决。更麻烦的是,这类偏移往往不会触发任何报错——系统不知道自己用的是旧数据,用户也看不出建议哪里不对,唯一的线索是月底电费或者碳账本对不上预期。这也是百家乐AI在数据层加入"数据新鲜度校验"的原因:每次生成调度建议前,系统会检查每一类输入数据的时间戳,一旦某类数据超过预设的过期阈值——比如天气预报超过3小时未更新——就会自动降级为保守策略,并在建议里标注"当前基于历史均值,非实时数据",而不是假装一切正常继续给出精确建议。

大模型在这套系统里负责什么

需要说清楚的是,百家乐AI并不是靠一个大模型直接吞下所有时序数据、吐出调度指令。大模型在这套系统里承担的是语义理解和意图翻译:把"晚上尽量别吵,空调声音小一点"这种自然语言,转成约束条件写进优化目标;把用户在App里的历史反馈,转成"这个家庭更在意舒适度还是更在意电费"的偏好权重;把系统内部的决策过程,转成用户能看懂的解释文本。真正处理光伏出力预测、负荷预测、电价曲线拟合、储能充放调度这些数值计算的,是专门的时序预测模型和优化算法,这部分内容在大模型与优化算法的分工里有更详细的拆解。把这两类能力混为一谈,是目前行业里对"家庭能源大模型"最常见的误解。

数据不是越多越好,边界在哪里

既然调度依赖这么多数据,是不是应该把所有传感器数据、所有行为记录都上传给模型,数据越多、判断越准?现实中不是这样。家庭活动模式这类数据一旦全量上云,隐私风险和数据传输成本都会显著上升,而调度决策真正需要的往往只是"聚合后的行为特征",比如"这个时段家里大概率有人",而不是"具体几点几分谁进了哪个房间"。哪些数据必须留在设备本地处理、哪些可以聚合后上云、哪些完全不需要离开家庭网络,是一个需要单独设计的分工问题,端侧AI与联邦学习的思路专门讨论了这一层。数据颗粒度要够用,但采集范围不该无限扩张,这两件事需要同时成立。

判断一套家庭能源AI靠不靠谱,先看它的数据来源表

回到最初的问题:家庭能源大模型到底需要看多少数据?答案不是一个数字,而是一张时间轴——六类数据、六种更新频率、一个统一的对齐机制。评价一套家庭能源AI系统是否可靠,比起问"用了什么模型",更值得问的问题是"电价数据多久刷新一次""光伏预测精确到什么颗粒度""数据延迟时系统会怎么处理"。这些问题的答案,往往比模型参数量更能说明这套系统能不能在真实家庭里稳定跑起来。