软件之家下载站

首页|资讯攻略|下载排行|最近更新

软件
软件
文章
当前位置:首页网络工具网页辅助 → GeneralNewsExtractor v0.2.6官方版
GeneralNewsExtractor v0.2.6官方版

GeneralNewsExtractor v0.2.6官方版

GeneralNewsExtractor(新闻网页正文通用抽取器)_v0.2.6官方版下载评分:5
下载地址
  • 软件大小:15KB
  • 软件语言:简体
  • 更新时间:2023-11-12 17:47:58
  • 软件类别:网页辅助
  • 软件性质:免费软件
  • 软件厂商:
  • 运行环境:pc软件
  • 软件等级:
  • 官方网址:https://github.com/kingname/GeneralNewsE
  • 版本:v0.2.6官方版
  • 软件介绍
  • 软件截图
  • 猜你喜欢
  • 同类推荐
  • 相关文章

软件Tags:

GeneralNewsExtractor(新闻网页正文通用抽取器)是一个基于《基于文本及符号密度的网页正文提取方法》论文用Python实现的正文抽取器,可以用来提取 HTML 中正文的内容、作者、标题。

开发介绍

  项目起源

  开发这个项目,源自于我在知网发现了一篇关于自动化抽取新闻类网站正文的算法论文——《基于文本及符号密度的网页正文提取方法》)

  这篇论文中描述的算法看起来简洁清晰,并且符合逻辑。但由于论文中只讲了算法原理,并没有具体的语言实现,所以我使用 Python 根据论文实现了这个抽取器。并分别使用今日头条、网易新闻、游民星空、观察者网、凤凰网、腾讯新闻、ReadHub、新浪新闻做了测试,发现提取效果非常出色,几乎能够达到100%的准确率。

  项目现状

  在论文中描述的正文提取基础上,我增加了标题、发布时间和文章作者的自动化探测与提取功能。

  目前这个项目是一个非常非常早期的 Demo,发布出来是希望能够尽快得到大家的使用反馈,从而能够更好地有针对性地进行开发。

  本项目取名为抽取器,而不是爬虫,是为了规避不必要的风险,因此,本项目的输入是 HTML,输出是一个字典。请自行使用恰当的方法获取目标网站的 HTML。

  本项目现在不会,将来也不会提供主动请求网站 HTML 的功能。

展开内容

软件截图

下载地址

  • PC版

同类推荐

推荐文章

用户评论

关于软件之家 | 联系方式 | 发展历程 | 版权声明 | 下载帮助(?) | 广告联系 | 网站地图 | 友情链接

Copyright 2019-2029 | 豫ICP备18039234号-1

声明: 信息举报QQ3596142387 邮箱3596142387@qq.com 所有软件和文章来自互联网 如有异议 请与本站联系 本站为非赢利性网站 不接受任何赞助和广告 技术支持:软件之家