Commonsense Knowledge Mining from Pretrained Models

TL;DR

使用预训练模型挖掘常识知识,未更新权重,表现优于监督方法。

cs.CL 🔴 高级 2019-09-02 5 次浏览
Joshua Feldman Joe Davison Alexander M. Rush
自然语言处理 常识知识 无监督学习 语言模型 知识挖掘

核心发现

方法论

该研究提出了一种使用大型预训练双向语言模型生成常识知识的方法。通过将关系三元组转换为被遮蔽的句子,利用模型估算实体间的点互信息来评估三元组的有效性。由于不更新模型权重,该方法不受任何单一常识知识库覆盖范围的影响。

关键结果

  • 在Wikipedia数据上表现优于监督方法,平均评分达到3.00,比现有方法高出0.50分。
  • 在ConceptNet测试集上,F1分数为78.8,接近监督原型方法的79.4。
  • 在句子生成中,语法和语义准确性对模型性能有显著影响。

研究意义

该研究展示了无监督方法在常识知识挖掘中的潜力,尤其是在处理新数据源时。它挑战了传统观点,即机器学习模型无法隐式学习常识,并为未来的知识挖掘技术提供了新的思路。

技术贡献

该方法与现有方法的根本区别在于不依赖特定数据库进行训练,而是利用语言模型的世界知识。这种方法提供了新的理论保证和工程可能性,尤其是在处理新数据时表现出色。

新颖性

这是首次使用预训练双向语言模型进行常识知识挖掘,避免了训练集与测试集泄漏问题,提供了一种更具普适性的知识挖掘方法。

局限性

  • 在ConceptNet测试集上表现不如监督方法,可能由于未针对特定数据集进行优化。
  • 生成的句子有时语法不正确或语义不准确,影响模型性能。

未来方向

未来可以探索该方法在非常识知识挖掘中的应用,并开发更广泛的评估方法以验证结论的有效性。

AI 总览摘要

常识知识是自然语言处理中的关键挑战,传统的监督方法在新数据上表现不佳。本文提出了一种利用预训练双向语言模型生成常识知识的新方法。通过将关系三元组转换为被遮蔽的句子,利用模型估算实体间的点互信息来评估三元组的有效性。实验表明,该方法在Wikipedia数据上表现优于监督方法,平均评分达到3.00。虽然在ConceptNet测试集上表现不如监督方法,但在处理新数据时表现出色。该研究展示了无监督方法在常识知识挖掘中的潜力,尤其是在处理新数据源时。未来可以探索该方法在非常识知识挖掘中的应用,并开发更广泛的评估方法以验证结论的有效性。

深度分析

研究背景

常识知识是关于世界的广泛已知事实,通常不会在自然语言中明确表达。由于数据稀疏性,机器学习模型难以隐式学习常识。传统方法通过常识知识库增强模型,但覆盖率低。常识知识库补全任务旨在提高这些资源的覆盖率。

核心问题

常识知识挖掘面临数据稀疏性和训练集与测试集泄漏问题。现有方法在新数据上表现不佳,难以广泛应用。如何利用语言模型的世界知识直接识别常识事实是一个关键问题。

核心创新

本文提出了一种新的无监督方法,通过预训练双向语言模型生成常识知识。该方法不依赖特定数据库进行训练,避免了训练集与测试集泄漏问题,提供了一种更具普适性的知识挖掘方法。

方法详解

  • �� 使用预训练双向语言模型生成常识知识
  • �� 将关系三元组转换为被遮蔽的句子
  • �� 估算实体间的点互信息以评估三元组的有效性
  • �� 不更新模型权重,避免特定知识库的覆盖影响

实验设计

实验使用Wikipedia和ConceptNet数据集,评估无监督方法与监督方法的性能。使用BERT-large进行遮蔽语言模型评估,GPT-2进行句子生成。通过EM算法进行聚类分析,调整PMI权重。

结果分析

在Wikipedia数据上表现优于监督方法,平均评分达到3.00。在ConceptNet测试集上,F1分数为78.8,接近监督原型方法的79.4。句子生成的语法和语义准确性对模型性能有显著影响。

应用场景

该方法可用于常识知识库补全和新数据源的知识挖掘。它为无监督学习在自然语言处理中的应用提供了新的思路,尤其是在处理数据稀疏性和训练集与测试集泄漏问题时。

局限与展望

在ConceptNet测试集上表现不如监督方法,可能由于未针对特定数据集进行优化。生成的句子有时语法不正确或语义不准确,影响模型性能。未来可以探索该方法在非常识知识挖掘中的应用。

通俗解读 非专业人士也能看懂

想象你在一个图书馆里寻找一本书。传统方法就像依赖图书馆员推荐书籍,他们的推荐可能不适合你的需求。本文的方法则像是你自己通过书名和简介来判断书籍是否符合你的兴趣。这样即使是新书,你也能更好地判断它是否适合你。这种方法不依赖特定的推荐系统,而是利用你自己的判断力来选择书籍。

简单解释 像给14岁少年讲一样

嘿,小伙伴们!想象一下,你在玩一款游戏,里面有很多关卡。传统的方法就像是你只玩过几次就想通关,但这很难对吧?这篇论文的方法就像是你有一个超级攻略,能帮你在新关卡中找到通关的诀窍。它不依赖于之前的经验,而是帮助你在新的挑战中找到解决方案。是不是很酷呢?

术语表

点互信息 (Pointwise Mutual Information)

度量两个事件之间的统计相关性。

用于估算实体间的关系有效性。

遮蔽语言模型 (Masked Language Model)

一种语言模型,通过隐藏部分词语来预测上下文。

用于评估句子中词语的概率。

常识知识库 (Commonsense Knowledge Base)

包含广泛已知事实的数据库。

用于增强机器学习模型的常识能力。

预训练模型 (Pretrained Model)

在大量数据上训练过的模型,可用于多种任务。

用于生成常识知识。

无监督学习 (Unsupervised Learning)

无需标注数据进行学习的方法。

用于常识知识挖掘。

开放问题 这项研究留下的未解疑问

  • 1 如何提高生成句子的语法和语义准确性,以进一步提升模型性能。
  • 2 探索该方法在非常识知识挖掘中的应用,扩展其适用范围。

应用场景

近期应用

常识知识库补全

提高知识库的覆盖率,增强自然语言处理模型的常识能力。

远期愿景

知识挖掘技术的革新

推动无监督学习在知识挖掘中的应用,解决数据稀疏性问题。

原文摘要

Inferring commonsense knowledge is a key challenge in natural language processing, but due to the sparsity of training data, previous work has shown that supervised methods for commonsense knowledge mining underperform when evaluated on novel data. In this work, we develop a method for generating commonsense knowledge using a large, pre-trained bidirectional language model. By transforming relational triples into masked sentences, we can use this model to rank a triple's validity by the estimated pointwise mutual information between the two entities. Since we do not update the weights of the bidirectional model, our approach is not biased by the coverage of any one commonsense knowledge base. Though this method performs worse on a test set than models explicitly trained on a corresponding training set, it outperforms these methods when mining commonsense knowledge from new sources, suggesting that unsupervised techniques may generalize better than current supervised approaches.

cs.CL cs.AI cs.LG