数据与方法
这份规范解决什么问题
本页是人口未来统一的数据解释规范。它不替代具体数据源,也不把 Projection 写成确定未来;它规定产品如何说明一项数值从哪里来、经过什么计算、依赖哪些假设,以及当前还不能回答什么。
数据轨道
| 类型 | 含义 | 页面表达 |
|---|---|---|
| 实际观测数据 | 来源已经记录或统计发布的历史/当前数值 | 标记 Actual,并注明统计时点和口径 |
| 估算数据 | 根据明确方法对缺失值或派生值进行计算 | 说明方法、输入和误差边界 |
| 预测数据 | 在模型和情景下对未来路径的推演 | 标记 Projection,不能写成一定发生 |
| 模拟结果 | 在一组参数和规则下运行的结果 | 说明参数、情景和可重复条件 |
| 假设参数 | 模型暂时采用的制度、行为或参数前提 | 明确“如果……则……”和复核条件 |
人口年龄推进
人口年龄推进不是把总人口按比例平移到下一年。产品需要尽量区分:
- 出生:新增 0 岁人口的输入;
- 死亡:不同年龄和性别的存活变化;
- 迁移:人口在空间之间的进入和离开;
- Cohort:同一出生年份或出生区间的人口队列;
- 年龄组转换:把单岁年龄、五岁年龄组或其他分组转换为研究所需的年龄范围。
当页面使用年龄组汇总、派生值或代理变量时,应保留输入数据、计算口径和适用范围。缺少县级年龄别迁移数据时,不能把省级结构直接包装成县域事实。
Projection 与情景
Projection 表示“在特定模型、参数和情景下的未来路径”,不表示未来一定如此。长期应支持并列比较:
- 基准情景;
- 高迁移 / 低迁移;
- 高生育 / 低生育;
- 其他有明确依据的合理情景。
当前如果只有单一情景,页面应说明它是当前可用的研究路径,而不是唯一未来。
可信度
高 / 中 / 低可信度不能只是装饰标签。判断至少应考虑:
- 数据是否为一手或官方来源;
- 时间、空间和年龄口径是否与问题匹配;
- 计算方法是否可追溯;
- 机制是否有 Evidence 支持;
- 本地适用性是否受到 Data Gap 影响。
可信度描述的是当前判断的解释强度,不是概率,也不等同于来源机构的权威程度。
时间滞后
出生、学龄、入学、毕业、就业、家庭形成、退休和公共系统调整的时间不同。人口变化影响教育、住房、医疗、财政和劳动力的时间滞后,应作为模型变量记录,不能用同一个年份直接替代所有领域的结果年份。
如果时间滞后没有经过数据校准,必须标记为 assumed 或 data_gap,不能为了页面完整填入具体年数。财政、制度、行为、容量和组织惯性属于 Buffer,应该解释为影响调整速度和幅度的条件,而不是综合评分项。
Stock、Flow 与 Capacity
领域模型必须区分:
- Stock:某个时点已经存在的人员、设施、住房或服务存量;
- Flow:一段时间内发生的出生、迁移、招聘、退休、调岗或撤并;
- Capacity:依据规则可以承载或配置的参考规模;
- Constraint:限制系统调整的制度、财政、距离和组织条件。
人口需求下降通常先影响新增 Flow,再通过退休、调岗、撤并等过程影响 Stock。不能把新增岗位减少直接写成已有存量同比减少。
统一结论结构
一个可发布的研究判断,至少同时说明:
数据类型 → 输入与计算 → 机制假设 → Evidence / Source → Confidence → Data Gap → 结论边界
如果中间缺少本地数据或机制证据,页面应明确显示 Data Gap 或 under_review,而不是填入看似精确的数字。
Research Chain Protocol v1
研究链以 Population → Spatial → System → Outcome → Feedback 表达,不允许从人口节点无机制地跳到下游结果。每个节点记录 layer、valueKind 和描述;每条关系记录机制 ID、来源 ID、置信度,以及可选的 Lag、Buffer、反向因素和 Data Gap。
Lag 记录关系的时间滞后状态:已知、假设、数据缺口或不适用。Buffer 记录制度、财政、经济、行为和容量等缓冲条件;它们不是综合评分项。
Place Data Readiness Gate
Place 是研究作用域,不是结论容器。一个地方研究必须同时声明目标层级、boundary version、观察/投影期间和具体 requirement profile。证据来源必须明确提供的 geography level;国家或省级来源不能自动变成县级事实。
当前只冻结两个模板:population_observation 可以在证据粒度匹配时支持人口事实展示;education_teacher_local_inference 需要人口、空间迁移、系统存量、地方规则和调整滞后五个维度。任一所需维度为 blocked 或 partial,结果都只能是 research_only。Readiness 不输出 score,也不把 Place archetype 当成真实地区。
Watch Indicator
Watch Indicator 是“下一步应该观察什么”的正式研究对象,不是实时数据接入、自动预警、风险评分或数值阈值。当前注册表位于 data/research/watch_indicators.json,每条记录声明观察维度、最低空间粒度、来源、Data Gap、重要性和定性信号规则。
source_ready 只用于已有直接来源;partial 表示来源相关但粒度或变量仍不足;data_gap 必须绑定 canonical Data Gap;watch_only 表示研究上知道应该观察,但当前没有可直接读取的正式来源。没有来源的指标不能借用相关领域来源来伪装成已观测事实。
Evidence Layer
Evidence Layer 位于 Source 与结论、机制、场景展示之间。Source 说明原始材料是什么;Evidence Item 说明它实际观察到什么、支持什么、不能说明什么,以及迁移到其他国家或地区前需要满足哪些条件。日韩案例不能因为人口阶段相近就自动成为中国预测。
当前 Evidence Item 统一记录 countryCode、证据类型、观察事实、证据作用域、期间、机制与结论引用、Source、边界和迁移前提。transferabilityConditions 不是相似度分数,也不参与排名;结构相似度和证据可迁移性仍然是两个不同问题。