← 返回首页
📊 Benchmark · NeurIPS 2022

NAS-Bench-Graph
图神经网络架构搜索的统一基准

Qin, Zhang, Wang, Zhang, Zhu · 清华大学 · NeurIPS 2022 Datasets & Benchmarks

2022 26,206 个架构 9 个数据集 查表即得性能

🎯 论文要解决什么问题?

GraphNAS(图神经网络架构搜索)研究在学术界和工业界都引起了广泛关注。然而,该领域存在两大顽疾:

⚠️ 问题一:实验设置不统一
数据集划分、超参数设置、评估协议千差万别,不同论文的实验结果无法直接比较,甚至难以复现。
⚠️ 问题二:计算开销巨大
GraphNAS 需要反复训练大量 GNN 架构,对大规模图数据尤其不友好。没有充足计算资源的研究者根本无法参与。

这两个问题严重阻碍了 GraphNAS 研究的健康发展。在 CV 领域的 NAS 研究中,类似问题催生了 Tabular NAS Benchmark 的概念——把所有架构的评估结果预先计算好,存在一张表里,查表即可获得性能,无需重复训练。

NAS-Bench-Graph 就是将这个理念引入图领域,第一个专为 GraphNAS 设计的 Tabular Benchmark

🏗️ 基准设计:搜索空间

基准的核心是一个表达力强、但紧凑可遍历的搜索空间。设计包含两部分:

📐 宏观架构(Macro Space)

将 GNN 架构的计算过程建模为 有向无环图(DAG)。DAG 包含 6 个节点(含输入输出节点),每个中间节点只有一条入边。约束后共产生 9 种可能的宏观连接模式,涵盖链式、跳跃连接、密集连接等多种拓扑结构。

💡 巧妙之处:通过"单入边"约束,将宏观空间从天文数字压缩到 9 种可管理选项,同时保留了 JK-Net、ResNet-like、DenseNet-like 等代表性架构的表达能力。

🧩 候选操作(Operations)

选择了 7 种最广泛使用的 GNN 层作为候选操作:

操作全称特点
GCNGraph Convolutional Network经典谱域卷积
GATGraph Attention Network带注意力机制
GraphSAGESample and AggregatE采样邻居聚合
GINGraph Isomorphism Network最强表达力的 WL-test 等价
ChebNetChebyshev Network切比雪夫多项式近似
ARMAAuto-Regressive Moving Average自回归移动平均滤波器
k-GNNk-Order Graph Neural Network高阶子结构建模

此外还包含 Identity(残差连接)和全连接层两种辅助操作。

9
宏观拓扑选项
7
候选操作
26,206
唯一架构数

去重后共 26,206 个唯架构,覆盖大部分代表性 GNN 变体及其组合。

📊 数据集与评估协议

📚 9 个代表性数据集

数据集节点数边数特征维度类别应用领域
Cora2,7085,4291,4337引文图
CiteSeer3,3274,7323,7036引文图
PubMed19,71744,3385003引文图
Coauthor-CS18,33381,8946,80515合著图
Coauthor-Physics34,493247,9628,4155合著图
Amazon-Photo7,487119,0437458电商图
Amazon-Computers13,381245,77876710电商图
ogbn-arxiv169,3431,166,24312840大规模引文
ogbn-proteins132,53439,561,2528112蛋白质图

数据集涵盖从小规模(千级节点)到大规模(百万级边),覆盖引文、电商、蛋白质等多种应用场景。

📋 统一评估协议

为保障公平可复现,作者制定了标准化方案:

  • 数据集划分:遵循公开标准划分,或每类 20 训练 / 30 验证 / 其余测试
  • 超参数统一:固定学习率、隐藏层维度、dropout 等范围
  • 训练轮数:共训练 200 个 epoch,记录每个 epoch 的性能
  • 记录指标:训练/验证/测试精度、损失、延迟、参数量等
✅ ogbn-proteins 的特殊处理:由于 GIN 和 k-GNN 导致参数爆炸,GAT 和 ChebNet 导致 32GB GPU OOM,最终将候选操作限制为 5 种,产生 2,021 个可行架构。

🔍 核心发现

基于预计算的大量评估数据,作者做了深入分析,揭示若干有趣发现:

📈 性能分布:好架构常见,但"卓越"架构稀缺

大部分架构的性能在合理范围内,但能达到"顶尖"水平的架构极少。而且,这些顶尖架构在效率(延迟)方面差异巨大——如何同时找到高效且高精度的架构是一个挑战。

🎯 架构偏好:不同数据集偏向不同架构

不同图数据集在宏观拓扑和操作选择上差异显著。跨数据集的相关性分析表明,图数据集之间的模式比图像数据更复杂——简单地迁移最佳架构无法得到最优结果。

📌 与 CV 的对比:在图像数据上,某一数据集的最佳架构往往能在类似数据集上表现良好。但在图数据上,这种迁移效果明显更差,说明图数据的内在结构更多元。

🧬 架构空间的平滑性

架构空间具有一定程度的平滑性——相似架构往往有相似性能。这支持了进化搜索策略中变异操作的有效性。同时,架构的深层部分对性能影响更大,这为强化学习搜索策略(如对深层赋予更高权重)提供了启发。

🛠️ 与现有库的集成

NAS-Bench-Graph 已被集成到两个代表性 NAS 库中:

  • AutoGL:首个专门面向 GraphNAS 的开源库,由清华大学开发
  • NNI:微软广泛使用的通用 NAS 框架

实验表明,NAS-Bench-Graph 能轻松与随机搜索、强化学习、进化算法等多种搜索策略兼容。对于 GraphNAS 研究者来说,这意味着:

🎉 即插即用:设计新算法后,直接查表获取性能,无需等待 GPU 训练,从"天级"实验变成"秒级"实验。

💡 为什么这篇论文重要?

NAS-Bench-Graph 的历史地位类似于 NAS 开山之作 之于 CV 领域——它系统性地解决了 GraphNAS 研究中"没法比、比不了"的窘境:

  • ✅ 可比性:统一搜索空间 + 统一评估协议 → 结果可公平比较
  • ✅ 可复现性:代码和数据全部开源 → 结果可完全复现
  • ✅ 高效率:查表代替训练 → 实验从数天缩短到毫秒
  • ✅ 低门槛:无需大规模 GPU 资源 → 更多研究者可以参与

后续的 GraphNAS 研究几乎都把 NAS-Bench-Graph 作为标准测试平台,引用量已超 400+,成为 GraphNAS 领域的基础设施级工作。

📖 阅读建议

如果你想深入了解这篇论文:

  • 如果你是 GraphNAS 研究者:必读。理解搜索空间设计细节、数据集 split 和实验协议,将其作为未来实验的标准配置。
  • 如果你是 GNN 初学者:重点关注搜索空间设计(第 3.1 节)和核心发现(第 4 节),理解"为什么 GraphNAS 需要统一基准",对 GNN 搜索空间有整体认知。
  • 如果你做 NAS 但不是图方向:对比前面几篇 NAS 论文,观察从图像到图数据"基准迁移"过程中的设计权衡。

NAS-Bench-Graph 的工作可概括为:一个统一空间 × 九个数据集 × 26,206 个架构 → 一次昂贵的预处理 → 无数次的免费查表