当前位置: 首页 > news >正文

南昌建网站那家好如何免费搭建网站源码

南昌建网站那家好,如何免费搭建网站源码,wap手机,如何让谷歌收录网站本文利用20Newsgroup这个数据集作为Corpus(语料库)#xff0c;用户可以通过搜索关键字来进行查询关联度最高的News#xff0c;实现对文本的搜索引擎#xff1a; 1. 导入数据集 from sklearn.datasets import fetch_20newsgroupsnewsgroups fetch_20newsgroups()print(fNu…本文利用20Newsgroup这个数据集作为Corpus(语料库)用户可以通过搜索关键字来进行查询关联度最高的News实现对文本的搜索引擎 1. 导入数据集 from sklearn.datasets import fetch_20newsgroupsnewsgroups fetch_20newsgroups()print(fNumber of documents: {len(newsgroups.data)}) print(fSample document:\n{newsgroups.data[0]}) 2. 向量化单词 from sklearn.feature_extraction.text import CountVectorizer count CountVectorizer() count.fit(newsgroups.data) show_vocabulary(count)print(fSize of vocabulary: {len(count.get_feature_names_out())})def show_vocabulary(vectorizer):words vectorizer.get_feature_names_out()print(fVocabulary size: {len(words)} words)# we can print ~10 words per linefor l in np.array_split(words, math.ceil(len(words) / 10)):print(.join([f{x:15} for x in l])) 3. 搜索引擎 #将语料库进行转化 corpus_bow count.transform(newsgroups.data)#提供用户输入对输入内容进行转化为BoW - Bag of word query input(Type your query: ) query_bow count.transform([query])from sklearn.metrics.pairwise import cosine_similarity#比较输入内容与语料库中的相似度 similarity_matrix cosine_similarity(corpus_bow, query_bow) print(fSimilarity Matrix Shape: {similarity_matrix.shape}) 得到Similarity_matrix一共有N行表示语料库中的文档数。还有一列代表相似度系数。 第K行的相似度系数代表用户输入的文本与语料库中第K个文档的相似程度。 我们对相似度矩阵进行排序 similarities pd.Series(similarity_matrix[:, 0]) similarities.head(10) 那么和用户输入最相关的文档就是第一个了 print(Best document:) print(newsgroups.data[top_10.index[0]]) 结论本文利用Cosine_similarity比较文档的相似度从语料库找出最佳匹配的文档。 如果对单词的向量化BoW概念有问题可以看下我的另一篇文章。 CSDN 下面一篇文章我会具体分析Cosine_similarity的原理敬请关注
http://www.w-s-a.com/news/45209/

相关文章:

  • 怎么建自己的手机网站保定电子商务网站建设
  • 系部网站建设中期检查表创建网站的公司
  • 西宁网站建设优化重庆企业的网站建设
  • 贝壳企业网站管理系统徽与章网站建设宗旨
  • 郑州网站模板动漫设计与制作设计课程
  • 在线制作网站的工具岳阳网站设计改版
  • 网站建设需要汇报哪些内容前端开发的工作内容
  • 无锡阿凡达网站建设美团app开发公司
  • 个性化企业网站制作公司深圳高端网站定制公
  • 专业深圳网站定制开发企业网站开发 流程
  • 网站建设推广的软文php网站平台
  • 如何做代刷网站长外贸网站个性设计
  • 合同网站开发 设计 后期维护如何搭建海外网络
  • 提供网站建设服务优化大师哪个好
  • 军队营房基础建设网站哦咪咖网站建设
  • fifa17做任务网站app下载免费安装
  • 网站开发用哪些技术seo是什么意思为什么要做seo
  • 网站会动的页面怎么做的与网站建设有关的招标文件
  • 公司网站如何做seowordpress付费资源
  • 福田做商城网站建设哪家公司便宜点WordPress安装子目录
  • 南京建设交易中心网站wordpress 拼车
  • 上海今天发生的重大新闻5条河南网站seo费用
  • 广东深圳最新情况临安网站seo
  • 华为快速建站女人做春梦网站
  • 建外贸网站费用手机排行榜zol
  • 长治网站制作的网站做网站要什么知识条件
  • discuz 做门户网站wordpress怎么添加图片不显示图片
  • 东营网站建设方案范文百度应用搜索
  • 网站 常见推广js代码放wordpress哪里
  • 靖江网站开发徐州住房和城乡建设局网站