欧美三区_成人在线免费观看视频_欧美极品少妇xxxxⅹ免费视频_a级毛片免费播放_鲁一鲁中文字幕久久_亚洲一级特黄

python打造爬蟲代理池過程解析

系統 1638 0

最近在使用爬蟲爬取數據時,經常會返回403代碼,大致意思是該IP訪問過于頻繁,被限制訪問。限制IP訪問網站最常用的反爬手段了,其實破解也很容易,就是在爬取網站是使用代理即可,這個IP被限制了,就使用其他的IP。對于高大上的公司來說,他們基本都使用收費的代理,基本不會有什么問題,比較穩定。像我這樣的矮矬窮,肯定是用不起收費的代理。一般都是使用國內免費的代理,網上也有很多提供免費的代理。

很多人都是從網上爬取一批免費的代理IP,存放在存儲媒介中,例如excel文件或者數據庫。定時維護代理,保證代理可用。這個做法有個缺點,有些機器上并沒有裝有excel或者mysql、redis等數據庫,這就導致了的代理池無法正常使用。

我之前是做java開發的,經常會把一些常用的數據放在ArrayList中,使用起來非常方便,效率高,因此借鑒之前在java方面的經驗,將代理IP爬取下來存放在list列表中中,將list列表當做一個代理池,經常維護這個池里的代理。

我經常爬取免費代理的網站xicidaili swei360等,這些免費的代理足夠我使用了,能夠應付大多數的爬蟲工作。爬取過程需要用到requests和pyquery庫,沒有安裝的同學自行安裝。

首先介紹下爬取xicidaili網站的過程, 要先定義一個方法用于抓取xicidaili網站的,參數有兩個,一個是url,另外一個是要爬取代理網頁的頁數,也就是要爬幾頁,方法如下:

            
def get_xicidaili_proxy(url,page):
  for i in range(1,page):
    headers = {
      "User-Agent": "Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.110 Safari/537.36 SE 2.X MetaSr 1.0"}
    response = requests.get(url + str(i), headers=headers)

    html = response.text
    doc = pq(html)
    ip_list = doc('#ip_list')('tr:gt(0)').items()
    for item in ip_list:
      ip = item.find('td:nth-child(2)').text()
      port = item.find('td:nth-child(3)').text()
      http_type = item.find('td:nth-child(6)').text()
      proxy_ip = http_type + "://" + ip + ":" + port
      if http_type == 'HTTP':
        http_proxy_pool.append(proxy_ip)
      elif http_type == 'HTTPS':
        https_proxy_pool.append(proxy_ip)
      # print(proxy_ip)
          

定義了http_proxy_pool和https_proxy_pool兩個list變量,用于存儲http類型和https類型的代理。 使用PyQuery根據css偽選擇器提取出ip,端口和http類型信息,并按照http:// + ip+port的方式組合成一個字符串,存儲在已經定義好的http_proxy_tool和https_proxy_pool變量中。

爬取swei360網站代理的方法就不貼出來了,原理和爬取xicidaili網站是一樣的。

一個代理在使用之前要判斷是否可用,我們使用request的get請求的返回代碼判斷代理是否可用,返回200,就說明代理可用,返回其他的代碼就表示代理不可用,代碼如下:

            
def detect_proxy(test_url,http_type,proxy):
  headers = {
    "User-Agent": "Mozilla/5.0 (Windows NT 10.0; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/58.0.3029.110 Safari/537.36 SE 2.X MetaSr 1.0"}
  proxy={
    http_type : proxy
  }
  try:
    response = requests.get(test_url,proxies=proxy,headers=headers)
    if response.status_code in [200]:
      print('代理可用',proxy)
      return True
    else:
      print('代理不可用', proxy);
      delete_proxy(http_type,proxy)
      return False
  except(requests.exceptions.ProxyError,RequestException):
    print('代理不可用', proxy)
    delete_proxy(http_type, proxy)
    return False
          

定義了detect_proxy方法用于檢測代理是否可用,有三個參數,分別是測試網址,代理類型(http和https)和代理IP。當requests的請求返回200代碼時,就表示該代理可用,返回True,否則就是不可用,返回False。當遇到request異常或者其他的錯誤也認為代理不可用,返回False。對于不可用的代理,要從代理池中刪除。

從代理池中獲取代理時,我們使用的是從代理池中隨機返回一個代理,這樣就避免經常使用一個代理,從而遭到拒絕訪問。代碼如下:

            
def get_https_proxy():
  proxy_ip = random.choice(https_proxy_pool)
  return proxy_ip

def get_http_proxy():
  proxy_ip = random.choice(http_proxy_pool)
  return proxy_ip
          

為了保證代理的可用,當檢測到一個代理不可用時,要及時的清理掉。就是從http_proxy_pool和https_proxy_pool列表中刪除。

一個簡單的爬蟲代理池已經搭建好,總結下爬蟲代理池搭建的過程:

  • 從免費的代理網站上爬取代理信息,存放在列表中。
  • 提供從代理池中隨機獲取代理的方法。http類型的網站要使用http類型的代理,https類型的網站要使用https類型的代理,因此分別提供獲取http和https類型代理的方法。
  • 提供檢測代理是否可用的方法,代理可用返回True,不可用返回False。
  • 提供刪除代理的方法。

這個代理池其實相當的簡單,有一個弊端就是在檢測代理是否可用時,如果返回的不是200代碼就認為代理不可用,返回其他代碼的情況有很多,例如網絡不可用、測試網站不可訪問等。比較好的做法是給每個代理設置一個分值,例如10分,如果檢測到不可用就減1,當分數為0時,就確定該代理不可用,直接從代理池中移除。檢測到代理可用,就將分數設為10分。

這種做法給每個檢測到不可用代理一個改邪歸正的機會,不至于一刀切的拋棄掉。

以上就是本文的全部內容,希望對大家的學習有所幫助,也希望大家多多支持腳本之家。


更多文章、技術交流、商務合作、聯系博主

微信掃碼或搜索:z360901061

微信掃一掃加我為好友

QQ號聯系: 360901061

您的支持是博主寫作最大的動力,如果您喜歡我的文章,感覺我的文章對您有幫助,請用微信掃描下面二維碼支持博主2元、5元、10元、20元等您想捐的金額吧,狠狠點擊下面給點支持吧,站長非常感激您!手機微信長按不能支付解決辦法:請將微信支付二維碼保存到相冊,切換到微信,然后點擊微信右上角掃一掃功能,選擇支付二維碼完成支付。

【本文對您有幫助就好】

您的支持是博主寫作最大的動力,如果您喜歡我的文章,感覺我的文章對您有幫助,請用微信掃描上面二維碼支持博主2元、5元、10元、自定義金額等您想捐的金額吧,站長會非常 感謝您的哦!!!

發表我的評論
最新評論 總共0條評論
主站蜘蛛池模板: 国产爆操| 无码一区二区三区曰本A片 欧美综合激情网 | 亚州精品天堂中文字幕 | 手机国产日韩高清免费看片 | 欧美非洲黑人性xxxx | 日韩精品欧美一区二区三区 | 精品推荐国产麻豆剧传媒 | 欧美一级特黄aa大片视频 | 国产在视频线精品视频www666 | 丝袜美腿一区二区三区动态图 | 精品欧美一区二区精品久久久 | 国产精品久久久久影院色老大 | 鲁一鲁综合 | 国产午夜精品一区二区三区嫩草 | 成人福利视频 | 999精品久久久 | 爱爱视频天天干 | 天堂在线v| 成年人看的羞羞网站 | 一区二区三区四区不卡视频 | 久草国产电影 | 日本三级香港三级乳网址 | 欧美经典成人在观看线视频 | 五月丁香综合啪啪成人小说 | 欧洲精品欧美精品 | 精品伊人久久久大香线蕉欧美 | 午夜天堂精品久久久久 | 好吊色欧美一区二区三区四区 | 开心激情综合网 | 黑人精品欧美一区二区蜜桃 | 国产精品久久久久久久久久久久冷 | 国产欧美精品一区二区三区 | 激情小说色 | 99精品国产一区二区青青牛奶 | 奇米影视在线观看 | 男女性关系视频免费观看软件 | 国产欧美日韩在线观看 | 亚洲国产精品综合久久网络 | 久久99国产精一区二区三区 | 狠狠做深爱婷婷久久一区 | 天天拍拍夜夜出水 |