xiaolinBot（Twitter笑話集錦爬蟲(chóng)Bot） Step2－代碼優(yōu)化

HelKyle 發(fā)布于2019-07-25 10:23 / 1668人閱讀

摘要：代碼優(yōu)化簡(jiǎn)介這篇我們簡(jiǎn)要的討論一下代碼優(yōu)化，這里主要討論兩點(diǎn)過(guò)程到函數(shù)加入對(duì)的處理我們?cè)谥械木幋a是面向過(guò)程的，這個(gè)不利于復(fù)用，所以我們簡(jiǎn)單的將我們前面的代碼函數(shù)化，方便以后擴(kuò)展及別人的調(diào)用另外，代碼最好符合規(guī)范，方便自己和別人閱讀編碼創(chuàng)建

Step2 - 代碼優(yōu)化 簡(jiǎn)介

這篇我們簡(jiǎn)要的討論一下代碼優(yōu)化，這里主要討論兩點(diǎn)

過(guò)程到函數(shù)

加入對(duì)media的處理

PEP8

我們?cè)赟tep1中的編碼是面向過(guò)程的，這個(gè)不利于復(fù)用，所以我們簡(jiǎn)單的將我們前面的代碼函數(shù)化，方便以后擴(kuò)展及別人的調(diào)用

另外，Python代碼最好符合PEP8規(guī)范，方便自己和別人閱讀

編碼 創(chuàng)建 utils/common.py

import os
import requests

PROXIES = None

HEADERS = {
    "User-Agent": "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_10_1)"
                  " AppleWebKit/537.36 (KHTML, like Gecko) "
                  "Chrome/38.0.2125.122 Safari/537.36",
    "Accept": "text/html,application/xhtml+xml,"
              "application/xml;q=0.9,image/webp,*/*;q=0.8",
    "Accept-Encoding": "gzip,deflate,sdch",
    "Accept-Language": "zh-CN,zh;q=0.8"
}


################################
#
# requests Operation
#
################################


def GetPage(url, proxies=PROXIES, headers=HEADERS):
    r = requests.get(url, proxies=proxies, headers=headers)
    assert r.status_code == 200
    return r.text


def GetMedia(
        url, proxies=PROXIES, headers=HEADERS, chunk_size=512,
        media_type="pic"):
    r = requests.get(url, proxies=proxies, headers=headers, stream=True)
    filename = "download/" + media_type + "/" + os.path.basename(url)
    with open(filename, "wb") as fd:
        for chunk in r.iter_content(chunk_size):
            fd.write(chunk)
    return filename

這里主要封裝了兩個(gè)方法： GetPage 與 GetMedia

GetPage: 傳入頁(yè)面url 獲得整個(gè)頁(yè)面

GetMeida: 傳入圖片或者視頻的url，下載媒體文件到 download/pic 或者 download/video（主要為了后續(xù)支持百思不得姐的視頻）

main.py 更改為：

# coding: utf-8

from pyquery import PyQuery as pq
from utils.common import GetMedia, GetPage

__author__ = "BONFY CHEN "


####################
#
# main function
#
####################

def qiushi():
    url = "http://www.qiushibaike.com/"
    page = GetPage(url)
    d = pq(page)
    contents = d("div .article")
    for item in contents:
        i = pq(item)
        pic_url = i("div .thumb img").attr.src
        content = i("div .content").text()
        id = i.attr.id
        if pic_url:
            pic_path = GetMedia(pic_url)
            print("pic - {id}: {content} 
pic下載到{pic_path}".format(
                id=id, content=content, pic_path=pic_path))
        else:
            print("text - {id}: {content}".format(id=id, content=content))


def main():
    qiushi()


if __name__ == "__main__":
    main()

運(yùn)行結(jié)果：

PEP8

$ pip install pep8
$ pep8 xiaolinBot

然后如果有不符合規(guī)范的代碼，會(huì)顯示提示，然后去更改就行了

完整代碼

詳情見(jiàn) https://github.com/bonfy/xiaolinBot

歡迎關(guān)注一起交流

敬請(qǐng)期待下一篇：適配器

文章版權(quán)歸作者所有，未經(jīng)允許請(qǐng)勿轉(zhuǎn)載,若此文章存在違規(guī)行為，您可以聯(lián)系管理員刪除。

轉(zhuǎn)載請(qǐng)注明本文地址：http://www.ezyhdfw.cn/yun/37936.html

發(fā)表評(píng)論

登陸后可評(píng)論

0條評(píng)論

HelKyle

男|高級(jí)講師

我要關(guān)注我要私信

TA的文章

Arduino--數(shù)字電位器AD5252/1的使用

閱讀 1484·2021-11-22 09:34
做完自動(dòng)化測(cè)試，但別讓不會(huì)匯報(bào)毀了你...

閱讀 2663·2021-11-12 10:36
【手把手帶你刷LeetCode】——11.二叉搜索樹(shù)的范圍和（DFS）

閱讀 1182·2021-11-11 16:55
企業(yè)成功過(guò)渡到云計(jì)算需要徹底改革的IT部門

閱讀 2396·2020-06-22 14:43
IOS 底部margin失效

閱讀 1523·2019-08-30 15:55
小于12px的文本居中問(wèn)題

閱讀 2038·2019-08-30 15:53
BFC：塊級(jí)格式上下文詳解

閱讀 1826·2019-08-30 10:50
Bootstrap 網(wǎng)格系統(tǒng)布局

閱讀 1275·2019-08-29 12:15

亚洲中字慕日产2020,大陆极品少妇内射AAAAAA,无码av大香线蕉伊人久久,久久精品国产亚洲av麻豆网站

資訊專欄INFORMATION COLUMN

上云采購(gòu)季！| 2核2G4M爆款云服務(wù)器低至59元/年，更有多臺(tái)、長(zhǎng)期優(yōu)惠，快來(lái)選購(gòu)！

xiaolinBot（Twitter笑話集錦爬蟲(chóng)Bot） Step2－代碼優(yōu)化

相關(guān)文章

***xiaolinBot（Twitter笑話集錦爬蟲(chóng)Bot） Step1－最簡(jiǎn)爬蟲(chóng)***

發(fā)表評(píng)論

0條評(píng)論

HelKyle

男|高級(jí)講師

TA的文章

Arduino--數(shù)字電位器AD5252/1的使用

做完自動(dòng)化測(cè)試，但別讓不會(huì)匯報(bào)毀了你...

【手把手帶你刷LeetCode】——11.二叉搜索樹(shù)的范圍和（DFS）

企業(yè)成功過(guò)渡到云計(jì)算需要徹底改革的IT部門

IOS 底部margin失效

小于12px的文本居中問(wèn)題

BFC：塊級(jí)格式上下文詳解

Bootstrap 網(wǎng)格系統(tǒng)布局

最新活動(dòng)

資訊專欄INFORMATION COLUMN

上云采購(gòu)季！| 2核2G4M爆款云服務(wù)器低至59元/年，更有多臺(tái)、長(zhǎng)期優(yōu)惠，快來(lái)選購(gòu)！

xiaolinBot（Twitter笑話集錦爬蟲(chóng)Bot） Step2－代碼優(yōu)化

相關(guān)文章

發(fā)表評(píng)論

0條評(píng)論

男|高級(jí)講師

TA的文章

最新活動(dòng)

上云采購(gòu)季！| 2核2G4M爆款云服務(wù)器低至59元/年，更有多臺(tái)、長(zhǎng)期優(yōu)惠，快來(lái)選購(gòu)！