国产激情自拍_国产9色视频_丁香花在线电影小说观看 _久久久久国产精品嫩草影院

首頁 > 開發(fā) > Python > 正文

手把手教你從零開始用Python語言寫爬蟲程序

2026-04-29 18:58:54
字體:
供稿:網(wǎng)友
簡單來說互聯(lián)網(wǎng)是由一個(gè)個(gè)站點(diǎn)和網(wǎng)絡(luò)設(shè)備組成的大網(wǎng),我們通過瀏覽器訪問站點(diǎn),站點(diǎn)把HTML、JS、CSS代碼返回給瀏覽器,這些代碼經(jīng)過瀏覽器解析、渲染,將豐富多彩的網(wǎng)頁呈現(xiàn)我們眼前。如果我們把互聯(lián)網(wǎng)比作一張大的蜘蛛網(wǎng),數(shù)據(jù)便是存放于蜘蛛網(wǎng)的各個(gè)節(jié)點(diǎn),而爬蟲就是一只小蜘蛛,沿著網(wǎng)絡(luò)抓取自己的獵物(數(shù)據(jù))爬蟲指的是:向網(wǎng)站發(fā)起請(qǐng)求,獲取資源后分析并提取有用數(shù)據(jù)的程序;從技術(shù)層面來說就是 通過程序模擬瀏覽器請(qǐng)求站點(diǎn)的行為,把站點(diǎn)返回的HTML代碼/JSON數(shù)據(jù)/二進(jìn)制數(shù)據(jù)(圖片、視頻) 爬到本地,進(jìn)而提取自己需要的數(shù)據(jù),存放起來使用。

本文主要內(nèi)容,以最短的時(shí)間寫一個(gè)最簡單的爬蟲,可以抓取論壇的帖子標(biāo)題和帖子內(nèi)容。本文受眾,沒寫過爬蟲的萌新。

入門

0.準(zhǔn)備工作

需要準(zhǔn)備的東西: Python、scrapy、一個(gè)IDE或者隨便什么文本編輯工具。

1.技術(shù)部已經(jīng)研究決定了,你來寫爬蟲。

隨便建一個(gè)工作目錄,然后用命令行建立一個(gè)工程,工程名為miao,可以替換為你喜歡的名字。

scrapy startproject miao

隨后你會(huì)得到如下的一個(gè)由scrapy創(chuàng)建的目錄結(jié)構(gòu)

在spiders文件夾中創(chuàng)建一個(gè)python文件,比如miao.py,來作為爬蟲的腳本。

內(nèi)容如下:

2.跑一個(gè)試試?

如果用命令行的話就這樣:

cd miaoscrapy crawl NgaSpider

你可以看到爬蟲君已經(jīng)把你壇星際區(qū)第一頁打印出來了,當(dāng)然由于沒有任何處理,所以混雜著html標(biāo)簽和js腳本都一并打印出來了。

解析

接下來我們要把剛剛抓下來的頁面進(jìn)行分析,從這坨html和js堆里把這一頁的帖子標(biāo)題提煉出來。

其實(shí)解析頁面是個(gè)體力活,方法多的是,這里只介紹xpath。

0.為什么不試試神奇的xpath呢

看一下剛才抓下來的那坨東西,或者用chrome瀏覽器手動(dòng)打開那個(gè)頁面然后按F12可以看到頁面結(jié)構(gòu)。

每個(gè)標(biāo)題其實(shí)都是由這么一個(gè)html標(biāo)簽包裹著的。舉個(gè)例子:

<a id="t_tt1_33" class="topic" href="/read.php?tid=10803874">[合作模式] 合作模式修改設(shè)想</a>

可以看到href就是這個(gè)帖子的地址(當(dāng)然前面要拼上論壇地址),而這個(gè)標(biāo)簽包裹的內(nèi)容就是帖子的標(biāo)題了。

于是我們用xpath的絕對(duì)定位方法,把class='topic'的部分摘出來。

1.看看xpath的效果

在最上面加上引用:

from scrapy import Selector

把parse函數(shù)改成:

再次運(yùn)行就可以看到輸出你壇星際區(qū)第一頁所有帖子的標(biāo)題和url了。

遞歸

接下來我們要抓取每一個(gè)帖子的內(nèi)容。

這里需要用到python的yield。

yield Request(url=url, callback=self.parse_topic)

此處會(huì)告訴scrapy去抓取這個(gè)url,然后把抓回來的頁面用指定的parse_topic函數(shù)進(jìn)行解析。

至此我們需要定義一個(gè)新的函數(shù)來分析一個(gè)帖子里的內(nèi)容。

完整的代碼如下:

到此為止,這個(gè)爬蟲可以爬取你壇第一頁所有的帖子的標(biāo)題,并爬取每個(gè)帖子里第一頁的每一層樓的內(nèi)容。

爬取多個(gè)頁面的原理相同,注意解析翻頁的url地址、設(shè)定終止條件、指定好對(duì)應(yīng)的頁面解析函數(shù)即可。

Pipelines——管道

此處是對(duì)已抓取、解析后的內(nèi)容的處理,可以通過管道寫入本地文件、數(shù)據(jù)庫。

0.定義一個(gè)Item

在miao文件夾中創(chuàng)建一個(gè)items.py文件。

此處我們定義了兩個(gè)簡單的class來描述我們爬取的結(jié)果。

1. 寫一個(gè)處理方法

在miao文件夾下面找到那個(gè)pipelines.py文件,scrapy之前應(yīng)該已經(jīng)自動(dòng)生成好了。

我們可以在此建一個(gè)處理方法。

2.在爬蟲中調(diào)用這個(gè)處理方法。

要調(diào)用這個(gè)方法我們只需在爬蟲中調(diào)用即可,例如原先的內(nèi)容處理函數(shù)可改為:

3.在配置文件里指定這個(gè)pipeline

找到settings.py文件,在里面加入

這樣在爬蟲里調(diào)用

的時(shí)候都會(huì)由經(jīng)這個(gè)FilePipeline來處理。后面的數(shù)字400表示的是優(yōu)先級(jí)。

可以在此配置多個(gè)Pipeline,scrapy會(huì)根據(jù)優(yōu)先級(jí),把item依次交給各個(gè)item來處理,每個(gè)處理完的結(jié)果會(huì)傳遞給下一個(gè)pipeline來處理。

可以這樣配置多個(gè)pipeline:

Middleware——中間件

通過Middleware我們可以對(duì)請(qǐng)求信息作出一些修改,比如常用的設(shè)置UA、代理、登錄信息等等都可以通過Middleware來配置。

0.Middleware的配置

與pipeline的配置類似,在setting.py中加入Middleware的名字,例如

1.破網(wǎng)站查UA, 我要換UA

某些網(wǎng)站不帶UA是不讓訪問的。

在miao文件夾下面建立一個(gè)middleware.py

這里就是一個(gè)簡單的隨機(jī)更換UA的中間件,agents的內(nèi)容可以自行擴(kuò)充。

2.破網(wǎng)站封IP,我要用代理

比如本地127.0.0.1開啟了一個(gè)8123端口的代理,同樣可以通過中間件配置讓爬蟲通過這個(gè)代理來對(duì)目標(biāo)網(wǎng)站進(jìn)行爬取。

同樣在middleware.py中加入:

很多網(wǎng)站會(huì)對(duì)訪問次數(shù)進(jìn)行限制,如果訪問頻率過高的話會(huì)臨時(shí)禁封IP。

如果需要的話可以從網(wǎng)上購買IP,一般服務(wù)商會(huì)提供一個(gè)API來獲取當(dāng)前可用的IP池,選一個(gè)填到這里就好。

一些常用配置

在settings.py中的一些常用配置

我就是要用Pycharm

如果非要用Pycharm作為開發(fā)調(diào)試工具的話可以在運(yùn)行配置里進(jìn)行如下配置:

Configuration頁面:

Script填你的scrapy的cmdline.py路徑,比如我的是

/usr/local/lib/python2.7/dist-packages/scrapy/cmdline.py

然后在Scrpit parameters中填爬蟲的名字,本例中即為:

crawl NgaSpider

最后是Working diretory,找到你的settings.py文件,填這個(gè)文件所在的目錄。

示例:

按小綠箭頭就可以愉快地調(diào)試了。

參考

這里提供了對(duì)scrapy非常詳細(xì)的介紹。

http://scrapy-chs.readthedocs.io/zh_CN/0.24/

以下是幾個(gè)比較重要的地方:

scrapy的架構(gòu):

http://scrapy-chs.readthedocs.io/zh_CN/0.24/topics/architecture.html

xpath語法:

http://www.w3school.com.cn/xpath/xpath_syntax.asp

Pipeline管道配置:

http://scrapy-chs.readthedocs.io/zh_CN/0.24/topics/item-pipeline.html

Middleware中間件的配置:

http://scrapy-chs.readthedocs.io/zh_CN/0.24/topics/downloader-middleware.html

settings.py的配置:

http://scrapy-chs.readthedocs.io/zh_CN/0.24/topics/settings.html
發(fā)表評(píng)論 共有條評(píng)論
用戶名: 密碼:
驗(yàn)證碼: 匿名發(fā)表
国产激情自拍_国产9色视频_丁香花在线电影小说观看 _久久久久国产精品嫩草影院
99热免费观看| 国产一二区在线| 国产黄色在线免费观看| 国产一区二区三区四区尤物| 天堂资源中文在线| 五月亚洲综合| 精精国产xxxx视频在线中文版| 国产福利视频在线| 在线亚洲精品自拍| 男人天堂99| 成网站在线观看人免费| 国产区在线观看| www.夜夜操.com| 国产农村一级特黄α**毛片| 18加网站在线| 青青久在线视频免费观看| 狠狠干在线视频| 国产人成在线观看| 在线欧美一级视频| 国产免费视频| 国产精品18久久久久久久久久| 136福利第一导航国产在线| 2018中文字幕在线| 欧美精品日韩少妇| 国产精品xxx电影| 黄色av网站在线免费观看| 国产精品久久人| 国产尤物视频在线| 天堂网中文在线| 国产成人va亚洲电影| 天堂在线看视频| 日本韩国精品一区二区| 国产对白叫床清晰在线播放| 国产主播福利在线| 日本h片在线观看| 国产精品视频一区二区免费不卡 | 国产日本在线观看| 国产乱在线观看视频| 免费国产视频| 中文av字幕| 精品街拍一区二区| 中文字幕av中文字幕| 国产麻豆精品一区二区三区v视界| 69视频在线| 在线视频观看你懂的| 国产激情视频一区二区| 国产精品美女一区二区视频| 国产区在线视频| 精品推荐国产麻豆剧传媒| 精品成人一区二区三区免费视频| 国产不卡在线| 国产馆av播放| 91麻豆福利| 怡红院av在线| 免费在线高清av| 国产女王在线**视频 | 国产麻豆视频| 青青草在线视频免费观看| 香蕉视频在线看| 人成在线免费视频| 中文字幕在线永久在线视频| 国产私拍精品| 国产精品va在线观看视色| 在线天堂视频| 黄色国产网站在线观看| 国产精品99999| 阿v免费在线观看| 尤物视频网站在线观看| 国产日产精品久久久久久婷婷| 国产小视频在线观看| 国产95在线|亚洲| 久热精品视频在线播放| 最新黄网在线观看| www.狠狠艹| 国产传媒在线播放| 九九热免费在线视频| 国产99在线|亚洲| а√天堂8资源在线官网| 国产美女福利在线观看| 精品视频麻豆入口| 国产一二区在线观看| 亚洲精品影院在线| 国产黄色网页| √天堂中文在线| 黄色网址在线免费播放| 伊人222成人综合网| 国产小视频在线高清播放| 亚洲精品成人a| 国产超碰97| 中文字幕日本在线| 免费看成年人视频在线观看| 2021av在线| 国产香蕉在线| 国产特级淫片免费看| 成人欧美亚洲| 国产免费av网站| 四虎www视频| av在线1区2区| 69久久久久| 在线视频三区| 亚洲精品视频在线免费| 在线观看国产福利视频| 亚洲欧美日韩成人网| 在线视频中文字幕久| 精品成人一区二区三区免费视频| 国产精品伦理一区二区三区| 国产区高清在线| 最近中文字幕在线中文视频| 福利视频网站导航| 88av在线| 在线中文字幕av| 在线播放国产区| 免费的黄网站在线观看| 国产免费av高清在线| 中文字幕在线视频不卡| 国产天堂在线观看| 在线视频三区| 国产麻豆麻豆| 国产va在线观看| av中文在线| 国产亚洲精品拍拍拍拍拍| 国产成人综合美国十次| 在线亚洲电影| 丁香在线视频| 伊人免费在线| 国产麻豆视频免费观看| 国产不卡在线| 黄色片视频在线观看| 国产网站免费观看| 在线观看的av| 国产精品一区二区三区视频网站| 国产三级在线看| 欧美卡一卡二| 精品亚洲综合| √天堂资源地址在线官网| 亚洲精品aaaa精品| 国产区视频在线| 超碰在线97国产| 国产精品18久久久久网站| 午夜亚洲成人| 国产精品爱久久久久久久小说| 伊人资源视频在线| 国产麻豆综合视频在线观看| av在线播放网| 在线视频xx| 国产高清免费av在线| 午夜av在线播放| 国产在线看片| av在线第一页| 一区二区三区免费视频网站| 国产精品免费视频一区一| 福利视频在线导航| 女子免费在线观看视频www| 99热播在线观看| 精品国产福利一区二区在线| 国产激情视频网址| 国产精品欧美韩国日本久久| 国产精品一区二区三区四区色| 欧美xxxx黑人又粗又长| 日本国产在线| 日本福利在线| 另类视频在线| 国产九色在线| 国产系列在线观看| 国产激情视频在线观看| 91极品在线| 日本三级视频网站| h网址在线观看| gogogogo高清视频在线| 男人操女人免费网站| 国产在线观看a视频| 五月婷婷开心综合| 国产精品久久久久白浆| 在线视频99| 国产中文字幕av| 国产一级性片| 在线中文字幕av| 免费看的毛片| 国产精品久久麻豆| 夜夜操天天干| 国产免费人人看| 97国产视频| 男人操女人免费网站| 国产麻豆视频免费观看| 国产三区视频在线观看| 精品国产丝袜高跟鞋| 青青草视频在线观看| 国产精品视频一区麻豆| free性亚洲| 国产青青草在线| 欧美精品se| √天堂资源中文www| 黄网站app在线观看下载视频大全官网| 国产在线你懂得| 在线黄色av| 国产人成在线观看| 九九视频九九热| 国产精品视频一区二区免费不卡| 四虎成人免费| 2020亚洲男人天堂|