5 组实验 · 结果报告

591 房产 AI 估价优化 | 依据各组 9/23–9/24 按统一模板提交的结果 | 成文 2026-09-24

一、结论

这是 5 个组之间的内部训练对比,用来决定下一步往哪个方向投。不是上线成绩,也不是对外可比的行业排名。

原始明细交给 AI 去挖特征,有真实增量;
但把专家系统整个拿掉、让 AI 自己建模,怎么组合都比现在更差。

最优 · C 组
9.73%
AI 挖数据 + 保留专家系统
现状 · A 组
10.34%
今天线上的做法
全放手 · D 组
13.50%
两个开关都拨掉
自动框架 · E 组
约 14%
慢、偏竞赛,不适用

二、三个问题的答案

本轮实验就是为了回答这三件事。口径统一为七都误差率,与现状(10.34%)对比。

把原始明细交给 AI 去挖特征,值不值? C 组:AI 自己从原表挖,专家系统照旧承接
值 · 是唯一跑赢现状的做法
9.73% ← 10.34% 好 0.6 个百分点
AI 自主建模,能不能取代现在的专家系统? B 组:数据不变,只把估价流程交给 AI
不能
11.37% vs 10.34% 差 1.0 个百分点
数据和流程一起放开,让 AI 全权来做,行不行? D 组:原始明细 + AI 自由建模
不行,代价最大
13.50% vs 10.34% 差 3.2 个百分点
这三个数字只在本轮 5 个组之间可比。换算到复盘口径后的对比,以及与同业数字的关系,见第七节。

三、成绩总表

七都口径、逐笔等权、完全不剔异常。B、D 各有两条实现线并行跑,共 6 份提交。

这条线是什么 验证集测试集 误差≤10%误差≤20%
C ★AI 挖原始数据 + 当前专家系统 8.82%9.73% 72.5%89.2%
A现有业务特征 + 当前专家系统(现状对照) 9.31%10.34% 71.1%87.9%
BAI 自己建模 · 主线(数据不变,只换估价流程) 10.34%11.37% 67.0%86.8%
BAI 自己建模 · 并行线(同上,另一种做法) 9.55%未跑 73.1%90.1%
DAI 全权来做 · 主线(数据和流程都放开) 12.50%13.50% 55.3%81.9%
DAI 全权来做 · 并行线(同上,另一种做法) 11.55%未跑 62.3%85.6%
EAI 自我迭代框架(自动提假设、写代码、跑实验) 约 14% | 跑得慢、结果偏竞赛打榜,判定不适用,不纳入排序

误差占比两列,已跑测试集的取测试值,未跑的取验证值。两条「并行线」只跑了验证集。E 组数字为 9/24 口头同步,项目目录内仅有框架选型说明。

图 1 · 六条线的误差率(浅色=验证集,深色=测试集)

现状线 10.34% C · AI挖数据+专家 A · 现状对照 B · 并行线 B · 主线 D · 并行线 D · 主线 8.829.73 ★ 最优 9.3110.34 9.55 测试集未跑 10.3411.37 11.55 测试集未跑 12.5013.50 0%3%6% 9%12%15% 平均误差率(越短越好)
验证集 测试集 · 最优 测试集 测试集 · 落后现状

各条线的分母不同(8,431 ~ 8,814 笔),条形长度看方向,不作精确差值。

四、放开到什么程度最合适

本轮设计了两个开关:喂什么数据、谁来定估价方法。把结果填回去,答案就清楚了。

图 2 · 两个开关的实测结果(七都测试集误差率)

数据:处理过的汇总特征
数据:原始明细
方法由
专家系统
A · 现状
10.34%
今天线上的做法
C · 最优
9.73%
AI 挖数据,专家系统承接
方法由
AI 自己
B
11.37%
只换掉估价流程
D · 全放手
13.50%
两个开关都拨掉
换成原始明细后:
有专家系统承接 → 好 0.6 个百分点
没有专家系统 → 差 2.1 个百分点

E 组与 D 同格(原始明细 + AI 自主),只是改由框架自动驱动,约 14%,未纳入。

这是本轮最值钱的一句话:原始明细确实有价值,但这份价值需要专家系统来承接。 把数据打散喂给 AI,同时又撤掉承接它的规则骨架,等于两头落空。

图 3 · 把决策权交给 AI 的环节越多,成绩并非越好

9%10%11% 12%13%14% 15% A 10.34% C 9.73% ★ 最优 B 11.37% D 13.50% E 约 14% 全部人工把关只放手「挖特征」 +放手「建模」+放手「找原因」全部交给 AI 0 个环节1 个环节 2 个环节3 个环节 全部 ◀ 人管得多               人管得少 ▶

横轴的「环节数」按各组提交的协作记录逐项判读,明细见第五节矩阵。

放手 1 个环节最好,放手 3 个环节最差。值得交给 AI 的是「从原始表里找出哪些信息有用」这一件事;一旦连模型结构、误差归因也一起交出去,成绩就开始往下掉。

五、每组是什么,人和 AI 各干了什么

下面的分工不是印象,是从各组提交的协作记录里逐条对出来的。

图 4 · 六个研发环节由谁决定

研发环节 A
现状
C ★ B
主线
B
聚合线
D
主线
D
明细线
1 数据怎么关联 人纠错人纠错
2 用哪些特征 共同AIAI共同 AIAI
3 用什么模型 AIAI AIAI
4 下一步往哪试 共同共同共同AI 共同共同
5 误差原因怎么找 共同共同共同共同 AIAI
6 哪些数据不许用
AI 独立决定的环节 0 / 61 / 62 / 62 / 6 3 / 63 / 6
人投入了多少 约 1 人天2 人天未单独记录约 0.5 小时 4–6 小时6–8 小时
机器跑了多久 7.5 小时约 26 小时2.5 小时15 小时 约 3 天约 4 天
人决定 人给方向,AI 执行验证 AI 独立决定

请看第 1 行和第 6 行:六条线无一例外,「数据怎么关联」和「哪些数据不许用」都由人把关,没有任何一条线敢交给 AI。

A 组 · 现状对照

处理过的数据 + 现有流程。今天线上在跑的那一套。

人定口径与保留专家主干,AI 负责接特征和跑训练。过程中验证出「旧挂牌融合」反而有害,已冻结关闭。

七都 10.34% 全台 11.26%

C 组 ★ 本轮最优

原始明细 + 现有流程。人给原表和关联关系,AI 自己挖特征,喂进专家系统。

有效方向:补齐这套房子自己的挂牌、租赁、前次成交信息。无效方向:宏观房贷环境、宽泛区域统计,均无稳定增量。

七都 9.73% 全台 10.56%

B 组 · 只换估价流程

数据不变,不给估价流程,让 AI 自己选特征、选模型、定迭代。两条线并行。

跑了 41 轮后收益明显递减:换模型、拆房型、加派生特征都基本没用。透天 17.2%、房型缺失 41.5% 是主要误差来源。

主线 11.37% 并行线 9.55%(只跑了验证集)

D 组 · 全放手

原始明细 + AI 自由建模。两个开关都拨掉,即张总原「纯自主方案」。两条线并行。

跑得最久、成绩最差。误差集中在低价段(<10 万/坪)和偏远郊县;挂牌类特征全部被淘汰。

主线 13.50% 并行线 11.55%(只跑了验证集)

E 组 · 自动框架

与 D 同格,改由 AI 自我迭代框架管闭环:自动提假设、写代码、跑实验、看反馈。

约 14%,比全放手还差。跑得慢,且框架本身是为竞赛打榜设计的,与我们要的可上线、可解释、可维护不是一回事。判定不适用,本轮不再投入。

14% 不纳入排序

六、为什么「全交给 AI」走不通

把研发过程分成四层看,AI 能独立胜任的只有最底下一层。

图 5 · AI 在四个层次上的实测表现

找出为什么估错误差归因
✗ 走不通
B 组筛了 23,026 笔、深查 1,000 例,原因分类全部「未知」——缺的是可比成交、车位价、装修这些逐笔证据,不是算力
定口径、守闸门数据怎么关联、哪些不许用
✗ 必须人来
六条线无一例外由人把关。本轮两次关键纠错都来自人:表关联错了、一批特征在 2011–2020 段整段是空的——AI 查不出来,分数还一切正常
选模型、调参数估价方法
△ 放手即差
交给 AI 自己定:11.37%,比现状 10.34% 差 1 个百分点;数据也一并放开则 13.50%
挖数据特征从原表找有用信息
✓ 放手有效
C 组 9.73%唯一赢过现状的做法;AI 挖出了人没想到去做的「房子自身挂牌/租赁/前次成交」

越往上,越依赖现实世界的事实与业务判断;越往下,越是可以批量试错的搜索问题——这正是 AI 的强项所在。

AI 自己优化时朝「考分」走,不朝「能上线」走。 C 组原方案用到了估价当下拿不到的字段,是人追问后才审计清掉,清掉后分数反而变差。六条线全部用的是「当前快照」,没有严格还原历史时点——没人守闸门,分数一定虚高。

七、口径说明

前六节的数字只在本轮 5 个组之间可比。要和历史汇报、和同业对齐,必须先换口径。

图 6 · 四个数字分属三种口径,只有同一排的能直接相减

可直接对比 8 月复盘口径 8.9% C 组方案换算后 10.4% 9 月复盘汇报 好 1.5 个百分点 待验证对比 口径未证实 8.2% 好时价 8.9% C 组方案换算后 相差 0.7 个百分点 — 但好时价口径不明,暂不能相减 8.0%8.9% 9.7%10.4%

与同业要比的是换算后的 8.9%,不是本轮内部的 9.73%——后者各组自己切分母(8,431 ~ 8,814 笔)、无外部评测回执、A 组测试集已被用过,只能比方向。 好时价 8.2% 的样本范围、是否剔异常、时间窗均不明,需拿到口径后再比对。

C 组方案在算法模型与 8 月复盘口径下重算为 8.9%,较 9 月复盘汇报的 10.4% 改善 1.5 个百分点。 同业好时价对外为 8.2%,与我方相差 0.7 个百分点;但其样本范围与计分规则尚无口径说明,两者暂不具备直接可比性,取得口径后另行比对。

八、本轮验证出来的有效方向

每条都有对应实验,可直接沿用到下一轮。

1 AI 挖数据特征
C 组靠这个跑到 9.73%,唯一赢过现状;挖出了人没想到去做的「房子自身挂牌/租赁/前次成交」。另一条线 0.5 小时人工筛完 700+ 字段。
2 人工介入定数据口径
六条线的「怎么关联」「哪些不许用」全部由人守。人工投入最多的 C 组(2 人天)成绩最好。
3 用 AI Loop 提验证效率
C 组单轮 117 个候选、B 组 41 轮机器仅占 2.5 小时、另一线 44 个配置只用 0.5 小时人工。与最终精度无关,这条单独成立。
4 人提假设,AI 做受控实验
0.5 小时换到一个硬结论:查不到自身挂牌的房子贡献了总误差的 54%,且补朝向、补装修两种方式都变差。自由搜索的 D 组跑 3–4 天没得到同等结论。
5 把「此路不通」也当成果
本轮已排除:旧挂牌融合有害、宏观与区域统计无增量、换模型拆房型收益递减、挂牌类特征全淘汰。省掉下一轮重复投入。
6 下一轮重点:补数据,不是调模型
B 组 1,000 例误差归因全部「未知」,卡在缺逐笔证据。距 6–8% 目标的差距主要不在模型侧,在挂牌关联覆盖率上。