🎯 论文要解决什么问题?
GraphNAS(图神经网络架构搜索)研究在学术界和工业界都引起了广泛关注。然而,该领域存在两大顽疾:
数据集划分、超参数设置、评估协议千差万别,不同论文的实验结果无法直接比较,甚至难以复现。
GraphNAS 需要反复训练大量 GNN 架构,对大规模图数据尤其不友好。没有充足计算资源的研究者根本无法参与。
这两个问题严重阻碍了 GraphNAS 研究的健康发展。在 CV 领域的 NAS 研究中,类似问题催生了 Tabular NAS Benchmark 的概念——把所有架构的评估结果预先计算好,存在一张表里,查表即可获得性能,无需重复训练。
NAS-Bench-Graph 就是将这个理念引入图领域,第一个专为 GraphNAS 设计的 Tabular Benchmark。
🏗️ 基准设计:搜索空间
基准的核心是一个表达力强、但紧凑可遍历的搜索空间。设计包含两部分:
📐 宏观架构(Macro Space)
将 GNN 架构的计算过程建模为 有向无环图(DAG)。DAG 包含 6 个节点(含输入输出节点),每个中间节点只有一条入边。约束后共产生 9 种可能的宏观连接模式,涵盖链式、跳跃连接、密集连接等多种拓扑结构。
🧩 候选操作(Operations)
选择了 7 种最广泛使用的 GNN 层作为候选操作:
| 操作 | 全称 | 特点 |
|---|---|---|
| GCN | Graph Convolutional Network | 经典谱域卷积 |
| GAT | Graph Attention Network | 带注意力机制 |
| GraphSAGE | Sample and AggregatE | 采样邻居聚合 |
| GIN | Graph Isomorphism Network | 最强表达力的 WL-test 等价 |
| ChebNet | Chebyshev Network | 切比雪夫多项式近似 |
| ARMA | Auto-Regressive Moving Average | 自回归移动平均滤波器 |
| k-GNN | k-Order Graph Neural Network | 高阶子结构建模 |
此外还包含 Identity(残差连接)和全连接层两种辅助操作。
去重后共 26,206 个唯架构,覆盖大部分代表性 GNN 变体及其组合。
📊 数据集与评估协议
📚 9 个代表性数据集
| 数据集 | 节点数 | 边数 | 特征维度 | 类别 | 应用领域 |
|---|---|---|---|---|---|
| Cora | 2,708 | 5,429 | 1,433 | 7 | 引文图 |
| CiteSeer | 3,327 | 4,732 | 3,703 | 6 | 引文图 |
| PubMed | 19,717 | 44,338 | 500 | 3 | 引文图 |
| Coauthor-CS | 18,333 | 81,894 | 6,805 | 15 | 合著图 |
| Coauthor-Physics | 34,493 | 247,962 | 8,415 | 5 | 合著图 |
| Amazon-Photo | 7,487 | 119,043 | 745 | 8 | 电商图 |
| Amazon-Computers | 13,381 | 245,778 | 767 | 10 | 电商图 |
| ogbn-arxiv | 169,343 | 1,166,243 | 128 | 40 | 大规模引文 |
| ogbn-proteins | 132,534 | 39,561,252 | 8 | 112 | 蛋白质图 |
数据集涵盖从小规模(千级节点)到大规模(百万级边),覆盖引文、电商、蛋白质等多种应用场景。
📋 统一评估协议
为保障公平可复现,作者制定了标准化方案:
- 数据集划分:遵循公开标准划分,或每类 20 训练 / 30 验证 / 其余测试
- 超参数统一:固定学习率、隐藏层维度、dropout 等范围
- 训练轮数:共训练 200 个 epoch,记录每个 epoch 的性能
- 记录指标:训练/验证/测试精度、损失、延迟、参数量等
🔍 核心发现
基于预计算的大量评估数据,作者做了深入分析,揭示若干有趣发现:
📈 性能分布:好架构常见,但"卓越"架构稀缺
大部分架构的性能在合理范围内,但能达到"顶尖"水平的架构极少。而且,这些顶尖架构在效率(延迟)方面差异巨大——如何同时找到高效且高精度的架构是一个挑战。
🎯 架构偏好:不同数据集偏向不同架构
不同图数据集在宏观拓扑和操作选择上差异显著。跨数据集的相关性分析表明,图数据集之间的模式比图像数据更复杂——简单地迁移最佳架构无法得到最优结果。
🧬 架构空间的平滑性
架构空间具有一定程度的平滑性——相似架构往往有相似性能。这支持了进化搜索策略中变异操作的有效性。同时,架构的深层部分对性能影响更大,这为强化学习搜索策略(如对深层赋予更高权重)提供了启发。
🛠️ 与现有库的集成
NAS-Bench-Graph 已被集成到两个代表性 NAS 库中:
- AutoGL:首个专门面向 GraphNAS 的开源库,由清华大学开发
- NNI:微软广泛使用的通用 NAS 框架
实验表明,NAS-Bench-Graph 能轻松与随机搜索、强化学习、进化算法等多种搜索策略兼容。对于 GraphNAS 研究者来说,这意味着:
💡 为什么这篇论文重要?
NAS-Bench-Graph 的历史地位类似于 NAS 开山之作 之于 CV 领域——它系统性地解决了 GraphNAS 研究中"没法比、比不了"的窘境:
- ✅ 可比性:统一搜索空间 + 统一评估协议 → 结果可公平比较
- ✅ 可复现性:代码和数据全部开源 → 结果可完全复现
- ✅ 高效率:查表代替训练 → 实验从数天缩短到毫秒
- ✅ 低门槛:无需大规模 GPU 资源 → 更多研究者可以参与
后续的 GraphNAS 研究几乎都把 NAS-Bench-Graph 作为标准测试平台,引用量已超 400+,成为 GraphNAS 领域的基础设施级工作。
📖 阅读建议
如果你想深入了解这篇论文:
- 如果你是 GraphNAS 研究者:必读。理解搜索空间设计细节、数据集 split 和实验协议,将其作为未来实验的标准配置。
- 如果你是 GNN 初学者:重点关注搜索空间设计(第 3.1 节)和核心发现(第 4 节),理解"为什么 GraphNAS 需要统一基准",对 GNN 搜索空间有整体认知。
- 如果你做 NAS 但不是图方向:对比前面几篇 NAS 论文,观察从图像到图数据"基准迁移"过程中的设计权衡。
NAS-Bench-Graph 的工作可概括为:一个统一空间 × 九个数据集 × 26,206 个架构 → 一次昂贵的预处理 → 无数次的免费查表