我的编程空间,编程开发者的网络收藏夹
学习永远不晚

爬虫时IP总是被封该怎么办

短信预约 -IT技能 免费直播动态提醒
省份

北京

  • 北京
  • 上海
  • 天津
  • 重庆
  • 河北
  • 山东
  • 辽宁
  • 黑龙江
  • 吉林
  • 甘肃
  • 青海
  • 河南
  • 江苏
  • 湖北
  • 湖南
  • 江西
  • 浙江
  • 广东
  • 云南
  • 福建
  • 海南
  • 山西
  • 四川
  • 陕西
  • 贵州
  • 安徽
  • 广西
  • 内蒙
  • 西藏
  • 新疆
  • 宁夏
  • 兵团
手机号立即预约

请填写图片验证码后获取短信验证码

看不清楚,换张图片

免费获取短信验证码

爬虫时IP总是被封该怎么办

这篇文章将为大家详细讲解有关爬虫时IP总是被封该怎么办,文章内容质量较高,因此小编分享给大家做个参考,希望大家阅读完这篇文章后对相关知识有一定的了解。

在我抓取网站遇到瓶颈,想剑走偏锋去解决时,常常会先去看下该网站的 robots.txt 文件,有时会给你打开另一扇抓取之门。

写爬虫有很多苦恼的事情,比如:

访问频次太高被限制;

如何大量发现该网站的 URL;

如何抓取一个网站新产生的 URL,等等;

这些问题都困扰着爬虫选手,如果有大量离散 IP 和账号,这些都不是问题,但是绝大部分公司都不具备这个条件的。

我们在工作中写的爬虫大多是一次性和临时性的任务,需要你快速完成工作就好,当遇到上面情况,试着看下 robots.txt 文件。

举个栗子:

老板给你布置一个任务,把豆瓣每天新产生的影评,书评,小组帖子,同城帖子,个人日志抓取下来。

初想一下,这任务得有多大,豆瓣有 1.6 亿注册用户,光是抓取个人日志这一项任务,每个人的主页你至少每天要访问一次。

这每天就得访问 1.6 亿次,小组/同城帖子等那些还没算在内。

设计一个常规爬虫,靠着那几十个 IP 是完不成任务的。

初窥robots.txt

当老板给你了上面的任务,靠着你这一两杆枪,你怎么完成,别给老板讲技术,他不懂,他只想要结果。

我们来看下豆瓣的 robots.txt。

爬虫时IP总是被封该怎么办

看图片上面红框处,是两个 sitemap 文件

打开 sitemap_updated_index 文件看一下:

爬虫时IP总是被封该怎么办

里面是一个个压缩文件,文件里面是豆瓣头一天新产生的影评,书评,帖子等等,感兴趣的可以去打开压缩文件看一下。

也就是说每天你只需要访问这个 robots.txt 里的 sitemap 文件就可以知道有哪些新产生的 URL。

不用去遍历豆瓣网站上那几亿个链接,极大节约了你的抓取时间和爬虫设计复杂度,也降低了豆瓣网站的带宽消耗,这是双赢啊,哈哈。

上面通过 robots.txt 的 sitemap 文件找到了抓取一个网站新产生 URL 的偏方。沿着该思路也能解决发现网站大量 URL 的问题。

再举个栗子:

老板又给你一个任务,老板说上次抓豆瓣你说要大量 IP 才能搞定抓豆瓣每天新产生的帖子,这次给你 1000 个 IP  把天眼查上的几千万家企业工商信息抓取下来。

看着这么多 IP 你正留着口水,但是分析网站后发现这类网站的抓取入口很少(抓取入口是指频道页,聚合了很多链接的那种页面)。

很容易就把储备的 URL 抓完了,干看着这么多 IP 工作不饱满。

如果一次性能找到这个网站几万乃至几十万个 URL 放进待抓队列里,就可以让这么多 IP 工作饱满起来,不会偷懒了。

我们来看他的robots.txt文件:

爬虫时IP总是被封该怎么办

爬虫时IP总是被封该怎么办

打开红框处的 sitemap,里面有 3 万个公司的 URL,上图是 1 月 3 号生成的,那个URL 是根据年月日生成的,你把 URL 改成 1 月 2  号,又能看到 2 号的sitemap里的几万个公司 URL,这样就能发现十几万个种子 URL 供你抓取了。

PS:上面的 sitemap 其实也能解决抓取天眼查最近更新的,新产生 URL 的问题。

小小的一个取巧,既降低了爬虫设计的复杂度,又降低了对方的带宽消耗。

关于爬虫时IP总是被封该怎么办就分享到这里了,希望以上内容可以对大家有一定的帮助,可以学到更多知识。如果觉得文章不错,可以把它分享出去让更多的人看到。

免责声明:

① 本站未注明“稿件来源”的信息均来自网络整理。其文字、图片和音视频稿件的所属权归原作者所有。本站收集整理出于非商业性的教育和科研之目的,并不意味着本站赞同其观点或证实其内容的真实性。仅作为临时的测试数据,供内部测试之用。本站并未授权任何人以任何方式主动获取本站任何信息。

② 本站未注明“稿件来源”的临时测试数据将在测试完成后最终做删除处理。有问题或投稿请发送至: 邮箱/279061341@qq.com QQ/279061341

爬虫时IP总是被封该怎么办

下载Word文档到电脑,方便收藏和打印~

下载Word文档

猜你喜欢

爬虫时IP总是被封该怎么办

这篇文章将为大家详细讲解有关爬虫时IP总是被封该怎么办,文章内容质量较高,因此小编分享给大家做个参考,希望大家阅读完这篇文章后对相关知识有一定的了解。在我抓取网站遇到瓶颈,想剑走偏锋去解决时,常常会先去看下该网站的 robots.txt 文
2023-06-16

怎么避免爬虫被封ip

这篇文章主要讲解了“怎么避免爬虫被封ip”,文中的讲解内容简单清晰,易于学习与理解,下面请大家跟着小编的思路慢慢深入,一起来研究和学习“怎么避免爬虫被封ip”吧!网络爬虫和ip代理的配合是做数据采集的用户需要了解和关注的问题。掌握了换ip之
2023-06-20

怎么判断python爬虫ip被封

这篇文章主要介绍了怎么判断python爬虫ip被封,具有一定借鉴价值,感兴趣的朋友可以参考下,希望大家阅读完这篇文章之后大有收获,下面让小编带着大家一起了解一下。python有哪些常用库python常用的库:1.requesuts;2.sc
2023-06-15

怎么使用爬虫代理ip避免被封

这篇文章主要为大家展示了“怎么使用爬虫代理ip避免被封”,内容简而易懂,条理清晰,希望能够帮助大家解决疑惑,下面让小编带领大家一起研究并学习一下“怎么使用爬虫代理ip避免被封”这篇文章吧。1、正确处理cookie,可以避免很多收集问题,建议
2023-06-15

爬虫IP代理池被封禁的原因是什么

本篇内容主要讲解“爬虫IP代理池被封禁的原因是什么”,感兴趣的朋友不妨来看看。本文介绍的方法操作简单快捷,实用性强。下面就让小编来带大家学习“爬虫IP代理池被封禁的原因是什么”吧!使用代理ip软件不需要很高的技术门槛。现在的代理服务提供商通
2023-06-20

Facebook账号老是被封被禁该怎么办

今天给大家介绍一下Facebook账号老是被封被禁该怎么办。文章的内容小编觉得不错,现在给大家分享一下,觉得有需要的朋友可以了解一下,希望对大家有所帮助,下面跟着小编的思路一起来阅读吧。Facebook作为社交媒体引流的第一大工具,无论在P
2023-06-05

使用爬虫时代理ip不足怎么办

这篇文章主要讲解了“使用爬虫时代理ip不足怎么办”,文中的讲解内容简单清晰,易于学习与理解,下面请大家跟着小编的思路慢慢深入,一起来研究和学习“使用爬虫时代理ip不足怎么办”吧!爬虫在工作过程中,经常被目标网站禁止访问,但是找不到原因,很烦
2023-06-20

Win8运行程序的时候总是提示内置管理员无法激活应用该怎么办?

Win8运行程序的时候总是提示内置管理员无法激活应用该怎么办?Win8系统使用“Windows照片查看器”来打开图片时发现图片无法打开,弹出提示“内置管理员无法激活此应用”,打开图片遇到&ld
2022-06-04

编程热搜

  • Python 学习之路 - Python
    一、安装Python34Windows在Python官网(https://www.python.org/downloads/)下载安装包并安装。Python的默认安装路径是:C:\Python34配置环境变量:【右键计算机】--》【属性】-
    Python 学习之路 - Python
  • chatgpt的中文全称是什么
    chatgpt的中文全称是生成型预训练变换模型。ChatGPT是什么ChatGPT是美国人工智能研究实验室OpenAI开发的一种全新聊天机器人模型,它能够通过学习和理解人类的语言来进行对话,还能根据聊天的上下文进行互动,并协助人类完成一系列
    chatgpt的中文全称是什么
  • C/C++中extern函数使用详解
  • C/C++可变参数的使用
    可变参数的使用方法远远不止以下几种,不过在C,C++中使用可变参数时要小心,在使用printf()等函数时传入的参数个数一定不能比前面的格式化字符串中的’%’符号个数少,否则会产生访问越界,运气不好的话还会导致程序崩溃
    C/C++可变参数的使用
  • css样式文件该放在哪里
  • php中数组下标必须是连续的吗
  • Python 3 教程
    Python 3 教程 Python 的 3.0 版本,常被称为 Python 3000,或简称 Py3k。相对于 Python 的早期版本,这是一个较大的升级。为了不带入过多的累赘,Python 3.0 在设计的时候没有考虑向下兼容。 Python
    Python 3 教程
  • Python pip包管理
    一、前言    在Python中, 安装第三方模块是通过 setuptools 这个工具完成的。 Python有两个封装了 setuptools的包管理工具: easy_install  和  pip , 目前官方推荐使用 pip。    
    Python pip包管理
  • ubuntu如何重新编译内核
  • 改善Java代码之慎用java动态编译

目录