(首次) 用自然语:言解释,图神经网络

2025-07-27 10:04:08      来源:央广网

【导读】GraphNarrator是Emory大学研究团队开发的首个为图神经网络生成自然语言解释的工具。通过构造和优化解释伪标签,再将这些标签蒸馏到一个端到端模型中,使模型能直接输出高质量的自然语言解释,让复杂的图神经网络决策过程变得透明可理解,且在多个真实数据集上验证了其有效性。

图神经网络(GNN)已成为处理结构化数据的核心工具,广泛应用于社交网络、药物设计、金融风控等场景。

然而,现有GNN的决策过程高度复杂,且常常缺乏透明度:为什么模型做出这样的预测?关键依据在哪?这成为阻碍其大规模落地的重要瓶颈。

已有方法多基于「重要子图提取」或「节点-边归因」,如GNNExplainer、PGExplainer等,但它们只能输出结构片段,不具备人类可读性,且缺乏对文本属性节点的处理能力(如文献图、商品图)。

Emory大学的研究团队提出了首个面向图神经网络的自然语言解释生成器GraphNarrator,首次实现从GNN输入输出中,生成高质量的自然语言解释,让图神经网络从「黑盒模型」变为「有理有据的决策体」。

GraphNarrator聚焦于一种重要的图类型Text-AttributedGraphs(TAGs),即节点特征为自然语言文本(如论文摘要、商品介绍、疾病描述等)。

论文贡献包括:

提出首个自然语言解释框架,将TAG图解释从结构层面扩展至语言层;

统一结构化与语言信息,桥接图结构推理与LLM理解能力;

开源工具链,提供高质量伪标签构造器+自监督蒸馏方法,便于迁移至任意GNN任务。

论文第一作者为Emory大学博士生BoPan,长期从事图学习与可解释人工智能方向研究。

共同第一作者为USC硕士生ZhenXiong和Emory大学博士生GuanchenWu,通讯作者为Emory计算机系副教授LiangZhao。

该研究获得ACL2025主会接收,提出首个面向图神经网络的自然语言解释生成器GraphNarrator。

让GNN开口说话

GraphNarrator总体包含三步:

1.构造解释伪标签(Pseudo-labelGeneration)

使用saliency-based解释方法提取「重要文本+关键邻居节点」,形式是每个特征(节点、边、token)的重要性。

将这些结构转化为结构化Prompt,和问题与预测一起输入GPT模型,生成可解释伪标签。

2.优化伪标签(FilteringviaExpert-DesignedCriteria)

通过两大标准筛选质量更高的伪标签:

忠实性(faithfulness):与模型预测一致,研究人员通过互信息(mutualinformation)的方式计算生成的文字解释与输入、输出之间的忠实性。

简洁性(conciseness):信息浓缩、可读性强,鼓励长度更短

GraphNarrator通过专家迭代(ExpertIteration)同时优化这两个目标,确保教师模型(teachermodel)生成高质量的解释。

3.蒸馏解释器(TrainingFinalExplainer)

将伪标签蒸馏进一个端到端模型(文章中使用LlaMA3.18B),直接输入图结构与文本,即可自动输出解释语句。

忠实、可读、用户更爱看!数据集

研究人员在多个真实世界的Text-AttributedGraph(TAG)数据集上对GraphNarrator进行了系统评估,包括:

Cora:论文引文图,节点为论文,文本为摘要

DBLP:作者合作图,文本为论文列表

PubMed:生物医学文献图

对比方法:

各主流LLM(LLaMA3.1-8B、GPT‑3.5、GPT‑4o)Zero-shot生成解释

SMV:基于GPT‑4o的saliency解释模板转换方法

GraphNarrator(基于LLaMA3.1-8B)

评估目标是检验GraphNarrator生成的自然语言解释是否忠实、准确、可读、受用户喜爱。

评测结果

研究人员通过自动方式和人工方式评测该方法生成的解释质量。

自动评测中,GraphNarrator在Simulatability上全面领先(+8‐10%),证明解释内容高度还原了GNN预测;

PMI‑10%覆盖率提升显著(平均+8.2%),表明能捕捉到最重要的token;Brevity(解释长度/输入长度)下降超13%,验证其「短小精炼」能力。

人工评测中,有计算语言学背景的评审从易读性、洞察力、结构信息、语义信息4个方向打分(1–7分制)。

结果表明各项均优于GPT‑4o、SMV,尤其在结构理解上优势明显(+33%),解释更流畅、逻辑清晰,获得真实用户的更高信任。

  兰州机场T1+T2面积8.9万平方米,去年吞吐量超过1700万人次,可以说不堪重负。乌鲁木齐机场T1+T2+T3面积18.48万平方米,需要承载超过2700万人次的吞吐量。

责编:许泓伯编辑

耳帝

  经查,李鹏新丧失理想信念,背弃初心使命,培植个人势力,搞“七个有之”;无视中央八项规定精神,违规接受宴请和车辆司机服务安排;对组织不忠诚、不老实,在组织函询时不如实说明问题,违背组织原则,卖官鬻爵,严重污染地方政治生态;廉洁底线失守,长期违规收受礼品、礼金;腐化堕落;贪婪无度,政商勾连,大搞新型腐败,利用职务便利为他人在矿产开发、企业经营、干部选拔任用等方面谋利,并非法收受股权股份等巨额财物。

评论圈智搜分享大赛

  中国名义税负一直高于实际税负。所谓名义税负是指企业名义上该缴纳的税费。由于征管、企业对税法理解等原因,实际上企业不一定足额缴纳法律意义上的税费。

现在就出发

  据国际网球联合会发布的《2021年全球网球报告》,2021年全球参与网球运动的人口有8718万人,中国以1992万人成为全球网球参与人数排名第二的国家,仅次于美国,占全球总网球人口的22.9%。同时,中国网球场的数量也为全球第二,达49767个。网球教练则以11350人位居全球第五。

微博旅游之夜

  随着参与网球运动的人逐渐增多,中国网球的基础设施也在不断完善。纪宁告诉《环球时报》记者:“我们在做一个项目,在北京朝阳区规划一个‘大满贯网球文化公园’,将汇集所有大满贯要素。人们既能在此观看全球顶级赛事,也能在场地上训练和比赛。”纪宁说,这仅是一个案例,但从中可以窥见中国网球运动基础设施越来越完善,也越来越专业化。作为体育产业的参与者与观察者,纪宁表示,不仅北京,全国各地网球运动设施也发展得越来越好。

单依纯第五

  博汇股份被要求补税5亿元,则是因为公司生产的重芳烃衍生品被税务部门认定需要按照重芳烃缴纳消费税,博汇股份对此不认同,最终是否补税、如何补税等仍有待税企双方良性沟通。

留英博士迷奸多人想化学阉割减刑遭拒

  6月17日,澎湃新闻(www.thepaper.cn)从陈政高同志多位亲友处获悉,住房和城乡建设部原部长、党组书记陈政高同志,因病于2024年6月16日在北京逝世,享年72岁。/p>

吴昕是不是忘了自己是个女明星

  参与运营北京奥林匹克森林公园西畔的国家网球中心两片红土网球场地的维宁体育创始人、CEO纪宁8日告诉《环球时报》记者:“本就稀缺的网球场馆在郑钦文夺冠后变得更加炙手可热,现在根本都约不上。”/p>

以色列全境响防空警报

  因此在不断强化税收征管的同时,应该同步适度推进税制改革,适度降低名义税率,让企业实际税负维持在一个合理水平,同时国家财政收入也并不会由此减少,进而实现良性循环。