(如 word2vec、glove 等)和基于主题模型的方法(如 lda、plsa 等)。最后是基于机器学习的方

法分类,这种方法利用机器学习算法来训练模型,通过模型来预测文本之间的相似度。常见的基于机器学习的方法有支持向量机(sv)、神经网络等。

目前,在国内外,文本相似度计算已经取得了丰富的成果。国内方面,清华大学等机构的研究

者提出了基于深度学习的文本相似度计算方法,利用神经网络模型来捕捉文本的深层语义信息,实

现了较高的相似度计算精度。江苏师范大学的研究者提出了利用《新华字典》构建向量空间来做中

文文本语义相似度分析的方法,该方法在中文文本相似度计算方面取得了显著的效果。放眼国外,

google 的研究者提出了 word2vec 算法,该算法将词语表示为高维向量空间中的点,通过计算点之

间的距离来衡量词语之间的相似度。word2vec 算法在文本相似度计算领域具有广泛的影响。斯坦

福大学等机构的研究者提出了 bert 模型,该模型通过大量的无监督学习来捕捉文本的上下文信