编程工具›› WebMagic

WebMagic

WebMagic 0.7.3 最新版

大小:13.41 MB

语言:简体中文系统:WinAll, Win7, Win10

类别:编程工具时间:2017-07-31 15:32

  • WebMagic

WebMagic中文版是java上面经常的需要的一款爬虫类型的工具,现在就可以试试最新的0.7.3版本,功能以及使用上面都是完全的免费的,欢迎大家下载使用!

中文版功能

WebMagic是一个简单灵活的Java爬虫框架。基于WebMagic,你可以快速开发出一个高效、易维护的爬虫。webmagic采用完全模块化的设计,功能覆盖整个爬虫的生命周期(链接提取、页面下载、内容抽取、持久化),支持多线程抓取,分布式抓取,并支持自动重试、自定义UA/cookie等功能。

常见问题

(1)由于我这个爬虫的抓取有分页,而且它的分页通过js跳转的,抽取出来感觉有点麻烦,我想直接得到所有的信息,发现可以通过输入url地址请求得到所有的信息(这是网站的一个小问题,它没有设置每页数据记录条数的范围),但是需要登录才可以进行url地址的访问,就要使用cookie模拟登录。

(2)下面分析有关登录信息的cookie,我使用的是chrome,点击如图位置,会看到此网站的cookie,(如果已经访问了一段时间了,可以清除所有cookie然后重新登录再访问,否则可能会有很多的cookie,分析起来不方便),由于只有5个cookie,直接加上就可以访问了

WebMagic 0.7.3更新内容

本次更新增加了Downloader模块的一些功能。

#609 修复HttpRequestBody没有默认构造函数导致无法反序列化的bug。

#631 HttpRequestBody的静态构造函数不再抛出UnsupportedEncodingException受检异常。

#571 Page对象增加bytes属性,用于获取二进制数据。下载纯二进制页面时,请设置request.setBinarayContent(true),这样对于二进制内容不会尝试转换为String,减小开销。

#629 在HttpUriRequestConverter中会自动对一些导致URI异常的字符进行转移或过滤。

#610 自动识别编码时,可以识别Content-Type中charset为大写的情况。

#627 支持为Request单独设置页面编码,兼容同一站点多种编码方式的情况。

#613 Page对象增加charset属性,其值为request/site中设置的charset,或者为自动检测的charset(未定义时)。

#606 升级jsonpath到2.4.0

∨ 展开

同类推荐

特别下载

猜你喜欢

相关文章

热门推荐

下载排行

热门关键字

tv市场2024最新直播手游加速器手机免费加速器合集恋爱手游推荐少女漫画大全剧情RPG游戏推荐成品漫画亲朋游戏手机税务政务服务平台数字货币交易所体育比分app打砖块游戏SCP系列手游18楼必备软件大龄交友相亲软件荒野求生游戏超级英雄游戏konami科乐美游戏广场舞软件最终幻想游戏合集飞机模拟驾驶游戏假面骑士腰带模拟器夜里适合男生用的app恋爱养成游戏塞尔达传说系列游戏外国生存游戏手游冷月白狐汉化组冷月白狐300游戏合集

网友评论

我要跟帖
取消
查看所有评论 共 0