591 房产 AI 估价优化 | 依据各组 9/23–9/24 按统一模板提交的结果 | 成文 2026-09-24
把原始明细交给 AI 去挖特征,有真实增量;
但把专家系统整个拿掉、让 AI 自己建模,怎么组合都比现在更差。
本轮实验就是为了回答这三件事。口径统一为七都误差率,与现状(10.34%)对比。
七都口径、逐笔等权、完全不剔异常。B、D 各有两条实现线并行跑,共 6 份提交。
| 组 | 这条线是什么 | 验证集 | 测试集 | 误差≤10% | 误差≤20% |
|---|---|---|---|---|---|
| C ★ | AI 挖原始数据 + 当前专家系统 | 8.82% | 9.73% | 72.5% | 89.2% |
| A | 现有业务特征 + 当前专家系统(线上方案经 AI 优化 · 对照基准) | 9.31% | 10.34% | 71.1% | 87.9% |
| B | AI 自己建模 · 主线(数据不变,只换估价流程) | 10.34% | 11.37% | 67.0% | 86.8% |
| B | AI 自己建模 · 并行线(同上,另一种做法) | 9.55% | 未跑 | 73.1% | 90.1% |
| D | AI 全权来做 · 主线(数据和流程都放开) | 12.50% | 13.50% | 55.3% | 81.9% |
| D | AI 全权来做 · 并行线(同上,另一种做法) | 11.55% | 未跑 | 62.3% | 85.6% |
| E | AI 自我迭代框架(自动提假设、写代码、跑实验) | 约 14% | 跑得慢、结果偏竞赛打榜,判定不适用,不纳入排序 | |||
误差占比两列,已跑测试集的取测试值,未跑的取验证值。两条「并行线」只跑了验证集。E 组数字为 9/24 口头同步,项目目录内仅有框架选型说明。
图 1 · 六条线的误差率(浅色=验证集,深色=测试集)
各条线的分母不同(8,431 ~ 8,814 笔),条形长度看方向,不作精确差值。
本轮设计了两个开关:喂什么数据、谁来定估价方法。把结果填回去,答案就清楚了。
图 2 · 两个开关的实测结果(七都测试集误差率)
E 组与 D 同格(原始明细 + AI 自主),只是改由框架自动驱动,约 14%,未纳入。
图 3 · 把决策权交给 AI 的环节越多,成绩并非越好
横轴的「环节数」按各组提交的协作记录逐项判读,明细见第五节矩阵。
下面的分工不是印象,是从各组提交的协作记录里逐条对出来的。
图 4 · 六个研发环节由谁决定
| 研发环节 | A 现状 | C ★ | B 主线 | B 聚合线 |
D 主线 | D 明细线 |
|---|---|---|---|---|---|---|
| 1 数据怎么关联 | 人 | 人 | 人 | 人 | 人纠错 | 人纠错 |
| 2 用哪些特征 | 共同 | AI | AI | 共同 | AI | AI |
| 3 用什么模型 | 人 | 人 | AI | AI | AI | AI |
| 4 下一步往哪试 | 共同 | 共同 | 共同 | AI | 共同 | 共同 |
| 5 误差原因怎么找 | 共同 | 共同 | 共同 | 共同 | AI | AI |
| 6 哪些数据不许用 | 人 | 人 | 人 | 人 | 人 | 人 |
| AI 独立决定的环节 | 0 / 6 | 1 / 6 | 2 / 6 | 2 / 6 | 3 / 6 | 3 / 6 |
| 人投入了多少 | 约 1 人天 | 2 人天 | 未单独记录 | 约 0.5 小时 | 4–6 小时 | 6–8 小时 |
| 机器跑了多久 | 7.5 小时 | 约 26 小时 | 2.5 小时 | 15 小时 | 约 3 天 | 约 4 天 |
请看第 1 行和第 6 行:六条线无一例外,「数据怎么关联」和「哪些数据不许用」都由人把关,没有任何一条线敢交给 AI。
处理过的数据 + 现有流程。不是线上原样,而是借助 AI 对线上现有方案做过优化后的版本,作为其余各组的对照基准。
人定口径与保留专家主干,AI 负责接特征和跑训练。过程中验证出「旧挂牌融合」反而有害,已冻结关闭。
原始明细 + 现有流程。人给原表和关联关系,AI 自己挖特征,喂进专家系统。
有效方向:补齐这套房子自己的挂牌、租赁、前次成交信息。无效方向:宏观房贷环境、宽泛区域统计,均无稳定增量。
数据不变,不给估价流程,让 AI 自己选特征、选模型、定迭代。两条线并行。
跑了 41 轮后收益明显递减:换模型、拆房型、加派生特征都基本没用。透天 17.2%、房型缺失 41.5% 是主要误差来源。
原始明细 + AI 自由建模。两个开关都拨掉,即张总原「纯自主方案」。两条线并行。
跑得最久、成绩最差。误差集中在低价段(<10 万/坪)和偏远郊县;挂牌类特征全部被淘汰。
与 D 同格,改由 AI 自我迭代框架管闭环:自动提假设、写代码、跑实验、看反馈。
约 14%,比全放手还差。跑得慢,且框架本身是为竞赛打榜设计的,与我们要的可上线、可解释、可维护不是一回事。判定不适用,本轮不再投入。
把研发过程分成四层看,AI 能独立胜任的只有最底下一层。
图 5 · AI 在四个层次上的实测表现
越往上,越依赖现实世界的事实与业务判断;越往下,越是可以批量试错的搜索问题——这正是 AI 的强项所在。
前六节的数字只在本轮 5 个组之间可比。要和历史汇报、和同业对齐,必须先换口径。
图 6 · 四个数字分属三种口径,只有同一排的能直接相减
与同业要比的是换算后的 8.9%,不是本轮内部的 9.73%——后者各组自己切分母(8,431 ~ 8,814 笔)、无外部评测回执、A 组测试集已被用过,只能比方向。 好时价 8.2% 的样本范围、是否剔异常、时间窗均不明,需拿到口径后再比对。
每条都有对应实验,可直接沿用到下一轮。