python爬取海量表情包，讓你成為群里的斗圖王目標分析：最終效果圖：總結

發布時間：2023-07-03 14:05:18 作者：網友整理

最近加入了斗圖群，發現自己的表情包太少了，斗不過他們。今天用Python實現批量抓取百度圖片里面的表情包和他們決戰。

需要實現的效果圖：

目標

獲取百度圖片的URL，并且下載到本地

分析：

F12檢查來獲取圖片在源代碼的位置。可是發現源代碼里根本就找不到的。

源代碼

那就是通過動態加載完成的，我們來驗證一下

果然是這樣的，圖片鏈接在這個數據包里面，thumbURL對應著url，而且還發現pageNum: 30這個參數，表示一個數據包里面有30條數據（也就是30個圖片鏈接）
每一次請求的url參數，幾乎都一樣，只有一個參數是不同的，那就是pn，他指的是當前頁面中已經展示的圖片數目。

我們所需要的信息都已經找到，那么開始編寫代碼吧

import requests

class Spider(object):
    def __init__(self):

        # 初始化headers
        self.headers = {
            "User-Agent": "Mozilla/5.0 (macintosh; Intel Mac OS X 10_15_3) AppleWebKit/537.36 (Khtml, like Gecko) Chrome/80.0.3987.149 Safari/537.36"
        }
        # 指定存儲路徑
        self.path = '/Users/admin/Desktop/Image/'
        self.page = int(input('請輸入需要爬取的頁數：'))
    # 獲取翻頁url
    def get_parse_url(self):
        urls =[]
        for i  in range(1,self.page+1):
            urls.append('https://image.baidu.com/search/acjson?tn=resultjson_com&ipn=rj&ct=201326592&is=&fp=result&queryword=%E8%A1%A8%E6%83%85%E5%8C%85&cl=2&lm=-1&ie=utf-8&oe=utf-8&adpicid=&st=&z=&ic=&hd=&latest=©right=&word=%E8%A1%A8%E6%83%85%E5%8C%85&s=&se=&tab=&width=&height=&face=&istype=&qc=&nc=&fr=&expermode=&force=&pn={}&rn=30&gsm=1e&1586570843561='.format(30*i))
        return urls
    # 獲取圖片url
    def get_immage_url(self,urls):
        image_url = []
        for url in urls:
            response = requests.get(url,headers=self.headers).json()
            results = response.get('data')
            for i in results:
                image_url.append(i.get('thumbURL'))

        return image_url
    # 存儲
    def storage_image(self,image_url):
        i = 1 # 圖片編號標記
        for img_url in image_url:
            print('正在爬取第{}張'.format(i))
            if img_url is None:
                continue
            response = requests.get(img_url,headers=self.headers).content
            with open(self.path + '{}.jpg'.format(i),'wb') as f:
                f.write(response)
                i +=1

    def start(self):
        urls = self.get_parse_url()
        image_url = self.get_immage_url(urls)
        self.storage_image(image_url)

spider = Spider()
spider.start()

代碼解讀：