ICO Std 2002:2026 — 中文版 — 第5章 指标体系设计
第5章 指标体系设计
本章规定了排名方法论中指标体系设计的要求。它确立了指标选择、层次组织、有效性验证、初始权重分配、更新机制以及核心层和扩展层指标之间关系的规则。
5.1 指标选择标准
排名系统中包含的每个指标均应满足5.1.1至5.1.5规定的标准。排名实体应参照这些标准记录每个指标纳入的理由。
5.1.1 相关性
指标应与方法论中定义的排名目的直接相关。相关性应通过证明指标与被测属性之间的逻辑或经验联系来建立。
a) 排名实体应定义排名旨在测量的概念领域。
b) 每个指标应映射到该领域中至少一个已定义的概念。
c) 不得仅因数据可获取而纳入指标,须证明其与排名目的的关联。
5.1.2 可测量性
指标应是可测量的,可通过定量测量或通过允许一致的定性评估的已定义编码方案来实现。
a) 定量指标应具有已定义的测量单位和明确的操作性定义。
b) 定性指标应具有已定义的编码方案,包含明确可区分的等级和编码规则。
c) 不存在可靠测量或编码程序的指标不得纳入,直到此类程序被开发和验证。
5.1.3 数据可获取性
指标所需的数据应能在合理的时间范围和成本内从可获取的来源获得,详见第7章。
a) 排名实体应在纳入每个拟议指标前评估其数据的可获取性。
b) 当不同被排名实体之间的数据可获取性存在显著差异时,排名实体应评估该指标是否引入系统性偏差(见4.7)。
5.1.4 独立性
同一层次内的指标应呈现低相互冗余。排名实体应评估指标间的相关性并采取措施减少冗余。
a) 应检查同一层次指标之间的成对相关性。当相关系数的绝对值超过0.80时,排名实体应考虑:
1) 将相关指标合并为单一综合指标;
2) 删除相关指标之一;
3) 保留两个指标并记录分别纳入的理由。
b) 应使用适当方法(如方差膨胀因子)评估指标间的多重共线性。方差膨胀因子(VIF)超过10的指标应审查是否移除或合并。
5.1.5 稳健性
指标应对异常值和测量误差的影响具有稳健性。排名实体应:
a) 使用适当方法(如影响函数、截尾均值)测试每个指标对异常值的敏感性;
b) 记录每个指标的异常值处理程序(另见7.4.2);
c) 排除结果被少数极端观测值主导的指标,除非极端观测值具有实质性意义。
5.2 指标层次结构
指标体系应组织为层次结构,反映排名目的向可测量组件的逻辑分解。
5.2.1 层次级别
指标层次应由以下级别组成:
a) 第1级——维度:最宽泛的类别,代表排名目的的主要方面。第1级指标定义了指标体系的结构框架。
b) 第2级——子维度:每个维度内更具体的组件。第2级指标将维度分解为可测量的方面。
c) 第3级——具体测量项:最细粒度的、直接可测量的变量。第3级指标是采集数据的操作化变量。
5.2.2 层次深度
指标层次不应超过三级。当排名目的需要更细粒度的分解时,排名实体应:
a) 将较低级别的指标合并为第3级综合测量项;或
b) 记录超过三级的理由并获得同行评审批准(见4.5.4)。
5.2.3 层次间的逻辑关系
相邻级别指标之间的关系应明确定义:
a) 每个第1级指标应可分解为至少两个第2级指标。
b) 每个第2级指标应可分解为至少两个第3级指标。
c) 给定第1级指标下的第2级指标集合应共同覆盖该第1级指标的概念范围。
d) 应规定从低层到高层的聚合规则(见第6章和第8章)。
5.3 指标有效性验证
排名实体应在首次应用前及任何重大修订后验证指标体系的有效性。有效性验证应涵盖5.3.1至5.3.3规定的维度。
5.3.1 内容有效性
内容有效性评估指标体系是否充分覆盖了旨在测量的概念领域。
a) 排名实体应定义概念领域及其边界。
b) 至少三名领域专家组成的专家组应评估指标体系是否提供了对定义领域的全面覆盖。
c) 专家组识别的差距应通过增加指标、修订现有指标或记录局限性来解决。
5.3.2 结构有效性
结构有效性评估指标是否测量了其旨在测量的理论构念。
a) 排名实体应使用适当的统计方法评估结构有效性,可包括:
1) 探索性或验证性因子分析,检验指标是否加载到预期维度上;
2) 收敛有效性分析,评估理论上相关的指标是否确实存在相关;
3) 区分有效性分析,评估理论上应有区别的指标是否确实不相关。
b) 结构有效性分析的结果应予以记录,包括未能符合预期结构的指标及所采取的行动。
5.3.3 效标有效性
当存在外部效标或金标准时,排名实体应通过检验排名结果与外部效标之间的相关性来评估效标有效性。
a) 外部效标应独立于被验证的排名系统。
b) 排名实体应记录外部效标的选择及其选择理由。
c) 当不存在合适的外部效标时,排名实体应记录此局限性及所采用的替代验证方法。
5.3.4 验证文档
所有有效性验证分析的结果应记录在方法论报告中。文档应包括:
a) 所使用的方法及其假设;
b) 分析所基于的数据和样本;
c) 结果,包括统计检验值及其解释;
d) 识别的任何局限性及采取的应对措施。
5.4 初始权重分配
在正式权重确定过程(见第6章)之前,排名实体应建立初始权重方案。初始权重方案作为利益相关方咨询和敏感性分析的起点。
5.4.1 等权法
当不存在差异化权重的有力理论或经验依据时,排名实体应使用等权法作为初始方案。在等权法下,同一层次的所有指标获得相同的权重。
对于给定层次的 n 个指标,每个指标 i 的等权为:
\[w_i = \frac{1}{n}, \quad i = 1, 2, \ldots, n\]其中 $\sum_{i=1}^{n} w_i = 1$。
注:等权并不意味着同等重要;它反映的是缺乏可辩护的差异化权重依据。排名实体应通过第6章所述方法寻求建立更为知情权重方案。
5.4.2 德尔菲法
德尔菲法可用于通过结构化的专家咨询来推导初始权重。过程应包括:
a) 选择至少五名领域专家组成的专家组;
b) 至少两轮匿名专家评估;
c) 在轮次之间提供统计反馈(中位数和四分位距);
d) 收敛标准(如四分位距低于定义阈值),以确定何时达到充分共识。
5.4.3 层次分析法(AHP)
层次分析法可用于通过指标的两两比较来推导初始权重。AHP过程应满足以下要求:
a) 应为每个层次的指标构建两两比较矩阵。
b) 每个比较矩阵的一致性比率(CR)不应超过0.10。当CR > 0.10时,专家应修订比较。
c) 从比较矩阵导出的优先向量应归一化使总和为1。
5.4.4 主成分分析(PCA)
PCA可作为数据驱动方法用于辅助初始权重分配。当PCA用于此目的时:
a) 排名实体应报告每个保留成分解释的方差比例。
b) 从PCA载荷导出的权重应谨慎解释,并根据领域知识进行验证,因为PCA导出的权重反映的是数据结构而非实质性重要性。
c) 排名实体应记录保留的成分数量和使用的保留标准。
5.4.5 初始权重与最终权重的关系
初始权重方案是临时性的,须经过第6章规定的完整权重确定过程。最终权重可能与初始权重不同,原因包括:
a) 利益相关方咨询;
b) 敏感性分析(见6.3);
c) 方法论改进。
排名实体应记录初始权重与最终权重之间的差异及任何重大变更的原因。
5.5 指标更新机制
指标体系应接受定期评审,并在必要时进行更新,以确保其持续的相关性和有效性。
5.5.1 评审周期
排名实体应每不超过五年对指标体系进行一次正式评审。评审应评估:
a) 指标是否仍然与排名目的相关;
b) 数据格局是否发生了显著变化;
c) 是否应增加新指标或删除现有指标;
d) 指标体系的有效性是否得到维持(见5.3)。
5.5.2 指标变更的触发条件
除定期评审外,以下情况应触发指标评审:
a) 排名目的或范围发生重大变化;
b) 一个或多个指标所依赖的数据来源永久性不可获取;
c) 重大新研究的发表对指标的有效性或相关性提出质疑;
d) 识别到可归因于某指标的系统性偏差(见4.7)。
5.5.3 指标变更流程
对指标体系的任何变更应遵循有记录的过程,包括:
a) 记录变更及其理由的提案;
b) 拟议变更对排名结果的影响评估;
c) 不少于30个日历天的利益相关方意见征询期;
d) 排名实体做出有记录理由的决定;
e) 至少在实施前一个排名周期公开宣布变更,除非变更是为解决合规或伦理问题所必需。
5.5.4 版本管理
指标体系的每个版本应有唯一标识。版本标识符应包括:
a) 遵循定义模式的版本号(如主版本.次版本);
b) 生效日期;
c) 与前版本的变更摘要。
指标体系的所有先前版本应归档并可供审计使用。
5.6 扩展模块指标引用规则
本标准采用两层架构:核心层(本章及第4章至第8章)定义了适用于所有排名领域的方法论要求;扩展层定义了领域特定的指标和规则。
5.6.1 核心层指标设计方法论
核心层定义了指标选择、层次设计、有效性验证、权重分配和更新管理的通用方法论。该方法论无论排名领域如何,均普遍适用。
5.6.2 扩展层领域特定指标
扩展模块可定义核心层未涵盖的领域特定指标。此类指标应:
a) 满足5.1中规定的所有选择标准;
b) 符合5.2中规定的层次规则;
c) 按照5.3的规定进行有效性验证;
d) 遵循5.5中规定的更新机制。
5.6.3 扩展层指标的验证
扩展层指标应使用本章规定的方法论进行验证。验证应记录在扩展模块中,并服从与核心层指标相同的透明度要求。
a) 排名实体应验证扩展层指标不与第4章规定的原则相冲突。
b) 当扩展层指标采用领域特定的测量方法时,应以足够的详细程度记录这些方法,以允许独立验证。
c) 扩展层指标验证的结果应在核心方法论文档中引用。
注:两层架构在保持方法论一致性的同时实现了领域灵活性。扩展模块应明确引用本章,并声明其对核心层要求的符合性,而非重新规定要求。