色久综合AV在线_亚洲人成在线观看网站高清_av网页中文字幕_欧洲无码三级片在线看

<span id="lmdsf"><i id="lmdsf"></i></span>

<sub id="lmdsf"><tbody id="lmdsf"></tbody></sub>

<mark id="lmdsf"></mark>

?

徐州北大青鳥中博學(xué)院招生簡(jiǎn)章

當(dāng)前位置: 主頁(yè) > 學(xué)在青鳥 > 編程技巧 >

知乎熱門：如何提高爬蟲速度？

時(shí)間:2021-10-23 11:03來源:未知作者:代碼如詩(shī) 點(diǎn)擊: 次

如何優(yōu)化 Python 爬蟲的速度？單線程 urllib 感覺過于慢了，達(dá)不到數(shù)據(jù)量的要求（十萬級(jí)頁(yè)面）。有哪些可以提高爬取效率的方法？程序提速這個(gè)問題其實(shí)解決方案就擺在那里，要么通

如何優(yōu)化 Python 爬蟲的速度？單線程 urllib 感覺過于慢了，達(dá)不到數(shù)據(jù)量的要求（十萬級(jí)頁(yè)面）。有哪些可以提高爬取效率的方法？

程序提速這個(gè)問題其實(shí)解決方案就擺在那里，要么通過并發(fā)來提高單位時(shí)間內(nèi)處理的工作量，要么從程序本身去找提效點(diǎn)，比如爬取的數(shù)據(jù)用gzip傳輸、提高處理數(shù)據(jù)的速度等。

我會(huì)分別從幾種常見的并發(fā)方法去做同一件事情，從而比較處理效率。

簡(jiǎn)單版本爬蟲

我們先來一個(gè)簡(jiǎn)單的爬蟲，看看單線程處理會(huì)花費(fèi)多少時(shí)間？

import time

import requests

from datetime import datetime

def fetch(url):

r = requests.get(url)

print(r.text)

start = datetime.now()

t1 = time.time()

for i in range(100):

fetch('http://httpbin.org/get')

print('requests版爬蟲耗時(shí)：', time.time() - t1)

# requests版爬蟲耗時(shí)：54.86306357383728

我們用一個(gè)爬蟲的測(cè)試網(wǎng)站，測(cè)試爬取100次，用時(shí)是54.86秒。

多線程版本爬蟲

下面我們將上面的程序改為多線程版本：

import threading

import time

import requests

def fetch():

r = requests.get('http://httpbin.org/get')

print(r.text)

t1 = time.time()

t_list = []

for i in range(100):

t = threading.Thread(target=fetch, args=())

t_list.append(t)

t.start()

for t in t_list:

t.join()

print("多線程版爬蟲耗時(shí)：", time.time() - t1)

# 多線程版爬蟲耗時(shí)：0.8038511276245117

我們可以看到，用上多線程之后，速度提高了68倍。其實(shí)用這種方式的話，由于我們并發(fā)操作，所以跑100次跟跑一次的時(shí)間基本是一致的。這只是一個(gè)簡(jiǎn)單的例子，實(shí)際情況中我們不可能無限制地增加線程數(shù)。

多進(jìn)程版本爬蟲

除了多線程之外，我們還可以使用多進(jìn)程來提高爬蟲速度：

import requests

import time

import multiprocessing

from multiprocessing import Pool

MAX_WORKER_NUM = multiprocessing.cpu_count()

def fetch():

r = requests.get('http://httpbin.org/get')

print(r.text)

if __name__ == '__main__':

t1 = time.time()

p = Pool(MAX_WORKER_NUM)

for i in range(100):

p.apply_async(fetch, args=())

p.close()

p.join()

print('多進(jìn)程爬蟲耗時(shí)：', time.time() - t1)

多進(jìn)程爬蟲耗時(shí)： 7.9846765995025635

我們可以看到多進(jìn)程處理的時(shí)間是多線程的10倍，比單線程版本快7倍。

協(xié)程版本爬蟲

我們將程序改為使用 aiohttp 來實(shí)現(xiàn)，看看效率如何：

import aiohttp

import asyncio

import time

async def fetch(client):

async with client.get('http://httpbin.org/get') as resp:

assert resp.status == 200

return await resp.text()

async def main():

async with aiohttp.ClientSession() as client:

html = await fetch(client)

print(html)

loop = asyncio.get_event_loop()

tasks = []

for i in range(100):

task = loop.create_task(main())

tasks.append(task)

t1 = time.time()

loop.run_until_complete(main())

print("aiohttp版爬蟲耗時(shí)：", time.time() - t1)

aiohttp版爬蟲耗時(shí)： 0.6133313179016113

我們可以看到使用這種方式實(shí)現(xiàn)，比單線程版本快90倍，比多線程還快。

結(jié)論

通過上面的程序?qū)Ρ?，我們可以看到，?duì)于多任務(wù)爬蟲來說，多線程、多進(jìn)程、協(xié)程這幾種方式處理效率的排序?yàn)椋篴iohttp > 多線程 > 多進(jìn)程。因此，對(duì)于簡(jiǎn)單的爬蟲任務(wù)，如果想要提高效率，可以考慮使用協(xié)程。但是同時(shí)也要注意，這里只是簡(jiǎn)單的示例，實(shí)際運(yùn)用中，我們一般會(huì)用線程池、進(jìn)程池、協(xié)程池去操作。

這就是問題的答案了嗎？

對(duì)于一個(gè)嚴(yán)謹(jǐn)?shù)某绦騿T來說，當(dāng)然不是，實(shí)際上還有一些優(yōu)化的庫(kù)，例如grequests，可以從請(qǐng)求上解決并發(fā)問題。實(shí)際的處理過程中，肯定還有其他的優(yōu)化點(diǎn)，這里只是從最常見的幾種并發(fā)方式去比較而已，應(yīng)付簡(jiǎn)單爬蟲還是可以的，其他的方式歡迎大家在評(píng)論區(qū)留言探討。

試聽課

(責(zé)任編輯：代碼如詩(shī))

------分隔線----------------------------

上一篇：策略模式開啟，跟 if/ else滿屏跑說再見！
下一篇：干貨丨什么是Java三元運(yùn)算符？基本用法有哪些？

欄目列表

推薦內(nèi)容

企業(yè)為什么拒絕錄用你！面試必看
今天我們就以幾個(gè)經(jīng)典案例來聊聊：我為什么要拒絕錄用你。...
新站如何做SEO優(yōu)化？你真的懂嗎？
網(wǎng)站的SEO過程也是相當(dāng)漫長(zhǎng)的，我想這正是新手站長(zhǎng)焦慮的原因...
【必讀】成為Java高手的25個(gè)學(xué)習(xí)要
想成為Java高手不容易，大家一起奮斗，總有一天有發(fā)光的時(shí)候。...
利用Java進(jìn)行移動(dòng)文件、剪切文件操
思路： 1.copy 2.delete 示例： /** * 復(fù)制單個(gè)文件 * @param String oldP...
利用Java加圖片水印以及文字水印方
今天有個(gè)學(xué)生說，他想把他上傳的圖片加上個(gè)水印的功能，以防...
分享一個(gè)Java通用的DAO及接口代碼—
徐州北大青鳥分享一個(gè)Java通用的DAO及接口代碼以下為DAO類代碼...

熱點(diǎn)內(nèi)容

北大青鳥服務(wù)電話：400-887-5191　 ICP備08102142號(hào)-3
徐州（軟件開發(fā)）校區(qū)地址:徐州市解放南路181號(hào)北大青鳥中博（六中對(duì)面）
南京（軟件開發(fā)）校區(qū)地址:南京市中山南路八條巷2號(hào)2F(洪武路和中山南路間)
南京（軟件測(cè)試）校區(qū)地址:南京安德門小行路16號(hào)（地鐵安德門1號(hào)出口,原江蘇警官學(xué)院內(nèi))

咨詢電話：0516-85628888

蘇公網(wǎng)安備 32030302000670號(hào)