欧美一级特黄大片做受成人-亚洲成人一区二区电影-激情熟女一区二区三区-日韩专区欧美专区国产专区

Python之Spider是什么

Python之Spider是什么?這個問題可能是我們日常學習或工作經常見到的。希望通過這個問題能讓你收獲頗深。下面是小編給大家?guī)淼膮⒖純热荩屛覀円黄饋砜纯窗桑?/p>

貴陽網站制作公司哪家好,找創(chuàng)新互聯建站!從網頁設計、網站建設、微信開發(fā)、APP開發(fā)、響應式網站等網站項目制作,到程序開發(fā),運營維護。創(chuàng)新互聯建站于2013年創(chuàng)立到現在10年的時間,我們擁有了豐富的建站經驗和運維經驗,來保證我們的工作的順利進行。專注于網站建設就選創(chuàng)新互聯建站

一、網絡爬蟲

網絡爬蟲又被稱為網絡蜘蛛,我們可以把互聯網想象成一個蜘蛛網,每一個網站都是一個節(jié)點,我們可以使用一只蜘蛛去各個網頁抓取我們想要的資源。舉一個最簡單的例子,你在百度和谷歌中輸入‘Python',會有大量和Python相關的網頁被檢索出來,百度和谷歌是如何從海量的網頁中檢索出你想要的資源,他們靠的就是派出大量蜘蛛去網頁上爬取,檢索關鍵字,建立索引數據庫,經過復雜的排序算法,結果按照搜索關鍵字相關度的高低展現給你。

千里之行,始于足下,我們從最基礎的開始學習如何寫一個網絡爬蟲,實現語言使用Python。

二、Python如何訪問互聯網

想要寫網絡爬蟲,第一步是訪問互聯網,Python如何訪問互聯網呢?

在Python中,我們使用urllib包訪問互聯網。(在Python3中,對這個模塊做了比較大的調整,以前有urllib和urllib2,在3中對這兩個模塊做了統一合并,稱為urllib包。包下面包含了四個模塊,urllib.request,urllib.error,urllib.parse,urllib.robotparser),目前主要使用的是urllib.request。

我們首先舉一個最簡單的例子,如何獲取獲取網頁的源碼:

import urllib.request
response = urllib.request.urlopen('https://docs.python.org/3/')
html = response.read()print(html.decode('utf-8'))

三、Python網絡簡單使用

首先我們用兩個小demo練一下手,一個是使用python代碼下載一張圖片到本地,另一個是調用有道翻譯寫一個翻譯小軟件。

3.1根據圖片鏈接下載圖片,代碼如下:

import urllib.request

response = urllib.request.urlopen('http://www.3lian.com/e/ViewImg/index.html?url=http://img16.3lian.com/gif2016/w1/3/d/61.jpg')
image = response.read()

with open('123.jpg','wb') as f:
    f.write(image)

其中response是一個對象

輸入:response.geturl()

      ->'http://www.3lian.com/e/ViewImg/index.html?url=http://img16.3lian.com/gif2016/w1/3/d/61.jpg'
      輸入:response.info()

      -><http.client.HTTPMessage object at 0x10591c0b8>

輸入:print(response.info())

->Content-Type: text/html
          Last-Modified: Mon, 27 Sep 2004 01:23:20 GMT
          Accept-Ranges: bytes
          ETag: "0f4b59230a4c41:0"
          Server: Microsoft-IIS/8.0
          Date: Sun, 14 Aug 2016 07:16:01 GMT
          Connection: close

          Content-Length: 2827

     輸入:response.getcode()

      ->200

      3.1使用有道詞典實現翻譯功能

           我們想實現翻譯功能,我們需要拿到請求鏈接。首先我們需要進入有道首頁,點擊翻譯,在翻譯界面輸入要翻譯的內容,點擊翻譯按鈕,就會向服務器發(fā)起一個請求,我們需要做的就是拿到請求地址和請求參數。

           我在此使用谷歌瀏覽器實現拿到請求地址和請求參數。首先點擊右鍵,點擊檢查(不同瀏覽器點擊的選項可能不同,同一瀏覽器的不同版本也可能不同),進入圖一所示,從中我們可以拿到請求請求地址和請求參數,在Header中的Form Data中我們可以拿到請求參數。

Python之Spider是什么

(圖一)

代碼段如下:

import urllib.requestimport urllib.parse

url = 'http://fanyi.youdao.com/translate?smartresult=dict&smartresult=rule&smartresult=ugc&sessionFrom=dict2.index'data = {}
data['type'] = 'AUTO'data['i'] = 'i love you'data['doctype'] = 'json'data['xmlVersion'] = '1.8'data['keyfrom'] = 'fanyi.web'data['ue'] = 'UTF-8'data['action'] = 'FY_BY_CLICKBUTTON'data['typoResult'] = 'true'data = urllib.parse.urlencode(data).encode('utf-8')
response = urllib.request.urlopen(url,data)
html = response.read().decode('utf-8')print(html)

上述代碼執(zhí)行如下:

{"type":"EN2ZH_CN","errorCode":0,"elapsedTime":0,"translateResult":[[{"src":"i love you","tgt":"我愛你"}]],"smartResult":{"type":1,"entries":["","我愛你。"]}}

對于上述結果,我們可以看到是一個json串,我們可以對此解析一下,并且對代碼進行完善一下:

import urllib.requestimport urllib.parseimport json

url = 'http://fanyi.youdao.com/translate?smartresult=dict&smartresult=rule&smartresult=ugc&sessionFrom=dict2.index'data = {}
data['type'] = 'AUTO'data['i'] = 'i love you'data['doctype'] = 'json'data['xmlVersion'] = '1.8'data['keyfrom'] = 'fanyi.web'data['ue'] = 'UTF-8'data['action'] = 'FY_BY_CLICKBUTTON'data['typoResult'] = 'true'data = urllib.parse.urlencode(data).encode('utf-8')
response = urllib.request.urlopen(url,data)
html = response.read().decode('utf-8')
target = json.loads(html)print(target['translateResult'][0][0]['tgt'])

四、規(guī)避風險

服務器檢測出請求不是來自瀏覽器,可能會屏蔽掉請求,服務器判斷的依據是使用‘User-Agent',我們可以修改改字段的值,來隱藏自己。代碼如下:

import urllib.requestimport urllib.parseimport json

url = 'http://fanyi.youdao.com/translate?smartresult=dict&smartresult=rule&smartresult=ugc&sessionFrom=dict2.index'data = {}
data['type'] = 'AUTO'data['i'] = 'i love you'data['doctype'] = 'json'data['xmlVersion'] = '1.8'data['keyfrom'] = 'fanyi.web'data['ue'] = 'UTF-8'data['action'] = 'FY_BY_CLICKBUTTON'data['typoResult'] = 'true'data = urllib.parse.urlencode(data).encode('utf-8')
req = urllib.request.Request(url, data)
req.add_header('User-Agent','Mozilla/5.0 (Macintosh; Intel Mac OS X 10_11_2) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/52.0.2743.116 Safari/537.36')
response = urllib.request.urlopen(url, data)
html = response.read().decode('utf-8')
target = json.loads(html)print(target['translateResult'][0][0]['tgt'])

View Code

上述做法雖然可以隱藏自己,但是還有很大問題,例如一個網絡爬蟲下載圖片軟件,在短時間內大量下載圖片,服務器可以可以根據IP訪問次數判斷是否是正常訪問。所有上述做法還有很大的問題。我們可以通過兩種做法解決辦法,一是使用延遲,例如5秒內訪問一次。另一種辦法是使用代理。

延遲訪問(休眠5秒,缺點是訪問效率低下):

import urllib.requestimport urllib.parseimport jsonimport timewhile True:
    content = input('please input content(input q exit program):')    if content == 'q':        break;

    url = 'http://fanyi.youdao.com/translate?smartresult=dict&smartresult=rule&smartresult=ugc&sessionFrom=dict2.index'
    data = {}
    data['type'] = 'AUTO'
    data['i'] = content
    data['doctype'] = 'json'
    data['xmlVersion'] = '1.8'
    data['keyfrom'] = 'fanyi.web'
    data['ue'] = 'UTF-8'
    data['action'] = 'FY_BY_CLICKBUTTON'
    data['typoResult'] = 'true'
    data = urllib.parse.urlencode(data).encode('utf-8')
    req = urllib.request.Request(url, data)
    req.add_header('User-Agent','Mozilla/5.0 (Macintosh; Intel Mac OS X 10_11_2) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/52.0.2743.116 Safari/537.36')
    response = urllib.request.urlopen(url, data)
    html = response.read().decode('utf-8')
    target = json.loads(html)    print(target['translateResult'][0][0]['tgt'])
    time.sleep(5)

View Code

代理訪問:讓代理訪問資源,然后講訪問到的資源返回。服務器看到的是代理的IP地址,不是自己地址,服務器就沒有辦法對你做限制。

步驟:

1,參數是一個字典{'類型' : '代理IP:端口號' } //類型是http,https等

proxy_support = urllib.request.ProxyHandler({})

2,定制、創(chuàng)建一個opener

opener = urllib.request.build_opener(proxy_support)

3,安裝opener(永久安裝,一勞永逸)

urllib.request.install_opener(opener)

3,調用opener(調用的時候使用)

opener.open(url)

五、批量下載網絡圖片

圖片下載來源為煎蛋網(http://jandan.net)

圖片下載的關鍵是找到圖片的規(guī)律,如找到當前頁,每一頁的圖片鏈接,然后使用循環(huán)下載圖片。下面是程序代碼(待優(yōu)化,正則表達式匹配,IP代理):

import urllib.requestimport osdef url_open(url):
    req = urllib.request.Request(url)
    req.add_header('User-Agent','Mozilla/5.0')
    response = urllib.request.urlopen(req)
    html = response.read()    return htmldef get_page(url):
    html = url_open(url).decode('utf-8')
    a = html.find('current-comment-page') + 23
    b = html.find(']',a)    return html[a:b]def find_image(url):
    html = url_open(url).decode('utf-8')
    image_addrs = []
    a = html.find('img src=')    while a != -1:
        b = html.find('.jpg',a,a + 150)        if b != -1:
            image_addrs.append(html[a+9:b+4])        else:
            b = a + 9
        a = html.find('img src=',b)    for each in image_addrs:        print(each)    return image_addrsdef save_image(folder,image_addrs):    for each in image_addrs:
        filename = each.split('/')[-1]
        with open(filename,'wb') as f:
            img = url_open(each)
            f.write(img)def download_girls(folder = 'girlimage',pages = 20):
    os.mkdir(folder)
    os.chdir(folder)
    url = 'http://jandan.net/ooxx/'
    page_num = int(get_page(url))    for i in range(pages):
        page_num -= i
        page_url = url + 'page-' + str(page_num) + '#comments'
        image_addrs = find_image(page_url)
        save_image(folder,image_addrs)if __name__ == '__main__':
    download_girls()

代碼運行效果如下:Python之Spider是什么

感謝各位的閱讀!看完上述內容,你們對Python之Spider是什么大概了解了嗎?希望文章內容對大家有所幫助。如果想了解更多相關文章內容,歡迎關注創(chuàng)新互聯行業(yè)資訊頻道。

分享標題:Python之Spider是什么
文章URL:http://aaarwkj.com/article46/pdpihg.html

成都網站建設公司_創(chuàng)新互聯,為您提供手機網站建設、網站內鏈、外貿建站、虛擬主機、電子商務、建站公司

廣告

聲明:本網站發(fā)布的內容(圖片、視頻和文字)以用戶投稿、用戶轉載內容為主,如果涉及侵權請盡快告知,我們將會在第一時間刪除。文章觀點不代表本網站立場,如需處理請聯系客服。電話:028-86922220;郵箱:631063699@qq.com。內容未經允許不得轉載,或轉載時需注明來源: 創(chuàng)新互聯

搜索引擎優(yōu)化
精品爆白浆一区二区三区| 韩国理伦三级做爰观看| 亚洲情色精品国产一区| 日本h电影一区二区三区| 妞干网视频这里只有精品 | 91桃色午夜福利视频| 操女逼无遮挡国产av| 高颜值美女后入内射视频| 日本韩国三级理伦久久久| 国产深夜福利在线观看| 中文字幕乱码日韩在线| 日日爱欧美精品亚洲成| 国产av剧情精品亚洲| 国产午夜亚洲精品羞羞网站| 六月综合激情丁香婷婷色| 国产av专区久久伊人亚洲| 久章草在线免费视频播放| 青青草视频免费观看高清在线观看新 | 亚洲天堂av福利在线观看| 91欧美精品一区二区| 精品一区二区日本高清| 一区二区三区成人高清视频| 国产视频成人免费观看| 日本免费精品一区二区三区中 | 久青青国产综合自拍视频在线观看| 日本特黄高清免费大片| 日本一区二区视频播放网站| 日韩国产欧美亚洲一区不卡| 三级视频一区二区三区| 中文字幕久久熟女蜜桃| 日本亚洲中文字幕网站| 91高清国产在线播放| 欧美高清一区二区在线观看| 亚洲第一国产综合自拍| 日韩一区二区三区av在线 | av毛片天堂在线观看| 91在线直播观看高清| 欧美三级高清视频在线播放| 天堂在线精品亚洲综合网| 黄色资源网日韩三级一区二区| 黑人巨大欧美一区二区|