摘要:代码优化简介这篇我们简要的讨论一下代码优化,这里主要讨论两点过程到函数加入对的处理我们在中的编码是面向过程的,这个不利于复用,所以我们简单的将我们前面的代码函数化,方便以后扩展及别人的调用另外,代码最好符合规范,方便自己和别人阅读编码创建
Step2 - 代码优化 简介
这篇我们简要的讨论一下代码优化,这里主要讨论两点
过程到函数
加入对media的处理
PEP8
我们在Step1中的编码是面向过程的,这个不利于复用,所以我们简单的将我们前面的代码函数化,方便以后扩展及别人的调用
另外,Python代码最好符合PEP8规范,方便自己和别人阅读
编码 创建 utils/common.pyimport os import requests PROXIES = None HEADERS = { "User-Agent": "Mozilla/5.0 (Macintosh; Intel Mac OS X 10_10_1)" " AppleWebKit/537.36 (KHTML, like Gecko) " "Chrome/38.0.2125.122 Safari/537.36", "Accept": "text/html,application/xhtml+xml," "application/xml;q=0.9,image/webp,*/*;q=0.8", "Accept-Encoding": "gzip,deflate,sdch", "Accept-Language": "zh-CN,zh;q=0.8" } ################################ # # requests Operation # ################################ def GetPage(url, proxies=PROXIES, headers=HEADERS): r = requests.get(url, proxies=proxies, headers=headers) assert r.status_code == 200 return r.text def GetMedia( url, proxies=PROXIES, headers=HEADERS, chunk_size=512, media_type="pic"): r = requests.get(url, proxies=proxies, headers=headers, stream=True) filename = "download/" + media_type + "/" + os.path.basename(url) with open(filename, "wb") as fd: for chunk in r.iter_content(chunk_size): fd.write(chunk) return filename
这里主要封装了两个方法: GetPage 与 GetMedia
GetPage: 传入页面url 获得 整个页面
GetMeida: 传入图片或者视频的url, 下载媒体文件到 download/pic 或者 download/video(主要为了后续支持百思不得姐的视频)
main.py 更改为:# coding: utf-8 from pyquery import PyQuery as pq from utils.common import GetMedia, GetPage __author__ = "BONFY CHEN运行结果: PEP8" #################### # # main function # #################### def qiushi(): url = "http://www.qiushibaike.com/" page = GetPage(url) d = pq(page) contents = d("div .article") for item in contents: i = pq(item) pic_url = i("div .thumb img").attr.src content = i("div .content").text() id = i.attr.id if pic_url: pic_path = GetMedia(pic_url) print("pic - {id}: {content} pic下载到{pic_path}".format( id=id, content=content, pic_path=pic_path)) else: print("text - {id}: {content}".format(id=id, content=content)) def main(): qiushi() if __name__ == "__main__": main()
$ pip install pep8 $ pep8 xiaolinBot
然后如果有不符合规范的代码,会显示提示,然后去更改就行了
完整代码详情见 https://github.com/bonfy/xiaolinBot
欢迎关注一起交流
敬请期待下一篇: 适配器
文章版权归作者所有,未经允许请勿转载,若此文章存在违规行为,您可以联系管理员删除。
转载请注明本文地址:https://www.ucloud.cn/yun/37936.html
摘要:最简爬虫环境准备最好使用另外需要两个必要的库一个封装了服务的库类似,使用非常方便开始实现第一个应用我们第一个应用实现的功能主要如下访问一个页面这里我们以糗事百科为例获得页面的内容进行简单的处理,获得我们需要的内容结果简单分析利用获得页面 Step1 - 最简爬虫 环境准备 Python3.5 最好使用venv 另外需要两个必要的库: requests : 一个封装了HTTP服务的py...
阅读 1373·2021-11-22 09:34
阅读 2583·2021-11-12 10:36
阅读 1113·2021-11-11 16:55
阅读 2326·2020-06-22 14:43
阅读 1460·2019-08-30 15:55
阅读 1978·2019-08-30 15:53
阅读 1766·2019-08-30 10:50
阅读 1221·2019-08-29 12:15