
1. 項目概述與核心價值最近在做一個關于移動應用用戶行為分析的項目需要大量真實的應用評論數據作為支撐。市面上公開的數據集要么時效性差要么覆蓋的應用不夠全面。于是我決定自己動手目標直指華為應用市場爬取其平臺上所有應用的評論數據。選擇華為應用市場一是因為其作為國內主流的應用分發平臺應用數量龐大評論數據豐富且具有代表性二是因為其Web端頁面結構相對規整適合作為爬蟲實戰的典型場景。這個項目聽起來簡單但實際操作起來從反爬策略應對、數據清洗到大規模異步抓取每一步都藏著不少門道。今天我就把這次從零搭建Scrapy爬蟲完整爬取華為應用市場評論數據的實戰經驗、踩過的坑以及優化技巧毫無保留地分享出來。無論你是剛接觸Scrapy的新手想找一個有挑戰性的實戰項目練手還是已經有一定經驗想了解如何應對中等復雜度的商業網站爬取相信這篇內容都能給你帶來直接的參考價值。整個項目的核心思路是首先我們需要獲取華為應用市場所有應用的唯一標識如包名或ID然后針對每一個應用模擬真實用戶訪問其評論頁面解析并提取結構化的評論數據最后考慮到海量應用和翻頁評論必須設計高效的異步抓取與存儲方案。在這個過程中我們將重點解決幾個關鍵問題如何高效地發現和遍歷所有應用如何穩定地獲取并解析評論頁面的動態內容如何設計爬蟲架構以應對可能的風控和反爬機制下面我們就從環境準備開始一步步拆解實現過程。2. 環境準備與Scrapy項目初始化工欲善其事必先利其器。在開始編寫爬蟲代碼之前我們需要搭建一個穩定、高效的開發環境。我個人的習慣是使用Python 3.8的版本這個版本在穩定性和庫兼容性上取得了很好的平衡。2.1 基礎環境搭建首先使用虛擬環境隔離項目依賴是一個好習慣可以避免不同項目間的包版本沖突。我通常使用venv來創建。# 創建項目目錄并進入 mkdir huawei_appmarket_crawler cd huawei_appmarket_crawler # 創建Python虛擬環境 python3 -m venv venv # 激活虛擬環境 # 在Windows上: venv\Scripts\activate # 在Mac/Linux上: source venv/bin/activate激活虛擬環境后安裝核心的Scrapy框架。Scrapy是一個為爬取網站數據、提取結構性數據而編寫的強大異步框架。pip install scrapy除了Scrapy我們還需要幾個輔助庫來應對更復雜的情況scrapy-user-agents: 用于隨機輪換User-Agent降低被識別為爬蟲的風險。fake-useragent: 方便地生成隨機的、真實的瀏覽器User-Agent字符串。pymongo(可選): 如果你打算將數據存儲到MongoDB這是一個高效的驅動。考慮到評論數據可能是半結構化的JSONMongoDB是個不錯的選擇。當然使用Scrapy自帶的JsonItemExporter導出到文件也同樣可行。pip install scrapy-user-agents fake-useragent pymongo2.2 Scrapy項目創建與結構解析接下來我們使用Scrapy的命令行工具快速生成項目骨架。scrapy startproject huawei_appmarket cd huawei_appmarket執行后你會看到生成的標準項目結構。理解每個文件的作用對后續開發至關重要huawei_appmarket/ ├── scrapy.cfg # 項目部署配置文件 └── huawei_appmarket/ # 項目Python模塊 ├── __init__.py ├── items.py # 定義要爬取的數據結構Item ├── middlewares.py # 自定義中間件如代理、User-Agent處理 ├── pipelines.py # 數據后處理管道清洗、驗證、存儲 ├── settings.py # 項目全局設置并發、延遲、中間件啟用等 └── spiders/ # 爬蟲文件存放目錄 └── __init__.py關鍵設置調整 (settings.py):在編寫爬蟲前我們先對settings.py進行一些關鍵配置這能事半功倍。# huawei_appmarket/settings.py BOT_NAME huawei_appmarket # 遵守robots協議對于商業網站建議先設置為False以測試但正式運行時應評估風險。 ROBOTSTXT_OBEY False # 配置并發請求數。對于華為應用市場這類網站不宜設置過高避免對服務器造成過大壓力或觸發風控。 # 我實測下來CONCURRENT_REQUESTS 16 是一個比較穩健的起點。 CONCURRENT_REQUESTS 16 # 下載延遲。添加隨機延遲可以模擬人類操作非常重要。 # 使用 RANDOMIZE_DOWNLOAD_DELAY True 并設置一個基礎延遲。 DOWNLOAD_DELAY 0.5 RANDOMIZE_DOWNLOAD_DELAY True # 啟用我們即將配置的User-Agent中間件 DOWNLOADER_MIDDLEWARES { scrapy.downloadermiddlewares.useragent.UserAgentMiddleware: None, # 禁用默認的 scrapy_user_agents.middlewares.RandomUserAgentMiddleware: 400, # 啟用隨機的 } # 配置Item Pipeline用于處理爬取到的數據。 ITEM_PIPELINES { huawei_appmarket.pipelines.HuaweiAppmarketPipeline: 300, } # 日志級別開發調試時設為DEBUG生產環境可設為INFO或WARNING。 LOG_LEVEL DEBUG # 設置一個合理的請求超時時間 DOWNLOAD_TIMEOUT 30注意DOWNLOAD_DELAY和CONCURRENT_REQUESTS需要根據目標網站的反爬強度和自身網絡狀況進行動態調整。一開始可以保守一些觀察請求成功率再逐步微調。3. 核心爬蟲邏輯設計與實現這是整個項目的核心。我們的爬蟲需要完成兩個主要任務1. 發現所有應用2. 爬取每個應用的評論。我將采用“廣度優先”的策略先由一個“應用列表爬蟲”收集所有應用的鏈接再由“評論詳情爬蟲”去具體抓取。3.1 定義數據模型 (items.py)首先在items.py中定義我們想要爬取的數據結構。清晰的Item定義能讓后續的數據處理和存儲更規范。# huawei_appmarket/items.py import scrapy class AppItem(scrapy.Item): # 應用基本信息從列表頁或詳情頁獲取 app_id scrapy.Field() # 應用唯一標識通常是包名或數字ID app_name scrapy.Field() # 應用名稱 app_category scrapy.Field() # 應用分類 app_url scrapy.Field() # 應用詳情頁URL # 可能還有其他字段如開發者、評分等根據需求擴展 class CommentItem(scrapy.Item): # 評論數據 app_id scrapy.Field() # 關聯的應用ID comment_id scrapy.Field() # 評論唯一ID如果有 user_name scrapy.Field() # 用戶名可能匿名化 user_rating scrapy.Field() # 用戶評分如5星 comment_text scrapy.Field() # 評論正文 comment_time scrapy.Field() # 評論時間 thumbs_up scrapy.Field() # 點贊數 # 可以添加設備型號、應用版本等字段3.2 應用列表爬蟲發現所有應用華為應用市場Web端通常有分類瀏覽、排行榜、搜索等入口。為了盡可能全地覆蓋應用一個有效策略是從“全部分類”頁面出發遍歷每個分類下的應用列表并處理分頁。我們在spiders/目錄下創建第一個爬蟲文件app_list_spider.py。# huawei_appmarket/spiders/app_list_spider.py import scrapy from urllib.parse import urljoin from huawei_appmarket.items import AppItem class AppListSpider(scrapy.Spider): name app_list allowed_domains [appgallery.huawei.com] # 華為應用市場Web版域名 start_urls [https://appgallery.huawei.com/categoryList] # 假設的分類列表頁 def parse(self, response): 解析分類列表頁提取所有分類的鏈接。 # 使用瀏覽器的開發者工具F12分析頁面找到分類鏈接的CSS選擇器或XPath。 # 這里的選擇器是示例實際需要根據目標網站HTML結構調整。 category_links response.css(div.category-list a::attr(href)).getall() for cat_link in category_links: full_cat_url urljoin(response.url, cat_link) # 將分類頁的請求交給 parse_category 方法處理 yield scrapy.Request(full_cat_url, callbackself.parse_category) def parse_category(self, response): 解析單個分類頁面提取該分類下的應用列表和分頁。 # 1. 提取當前頁的應用信息 app_elements response.css(div.app-item) # 示例選擇器 for app in app_elements: item AppItem() # 解析應用名稱、ID、詳情頁鏈接等 item[app_name] app.css(h4.app-title::text).get() # 詳情頁鏈接可能需要拼接 detail_path app.css(a.app-link::attr(href)).get() item[app_url] urljoin(response.url, detail_path) # 從詳情頁URL或元素中提取app_id # 例如URL可能為 https://.../app/C10123456則app_id為C10123456 item[app_id] item[app_url].split(/)[-1] item[app_category] response.css(h1.category-title::text).get() # 這里可以先yield item也可以先只收集URL在評論爬蟲里再抓詳情。 # 我選擇先yield讓Pipeline先存儲基礎信息。 yield item # 2. 同時為這個應用生成評論頁的初始請求交給評論爬蟲處理 # 評論頁URL通常有規律例如{app_url}/comment 或 {app_url}?tabreview # 需要實際分析。這里假設為 {app_url}?tabreviewpage1 comment_start_url f{item[app_url]}?tabreviewpage1 yield scrapy.Request(comment_start_url, callbackself.parse_comments, meta{app_id: item[app_id]}) # 3. 處理分頁查找“下一頁”按鈕 next_page response.css(a.next-page::attr(href)).get() if next_page: next_page_url urljoin(response.url, next_page) yield scrapy.Request(next_page_url, callbackself.parse_category) def parse_comments(self, response): 解析單個應用的評論第一頁。 這個方法的邏輯也可以獨立成一個單獨的爬蟲。 這里為了流程連貫放在一起。實際大型項目建議拆分。 # 評論數據解析邏輯見下一節。 pass實操心得選擇器調試使用scrapy shell ‘url’命令在終端快速測試你的CSS選擇器或XPath是否正確這是提高開發效率的關鍵。分頁策略對于“加載更多”這種動態分頁Ajax需要分析網絡請求找到真正的數據接口通常是返回JSON的API而不是解析頁面HTML。華為應用市場的評論很可能采用這種方式。去重Scrapy默認根據URL去重。確保應用的詳情頁URL或評論分頁URL能唯一標識該資源避免重復爬取。3.3 評論詳情爬蟲解析動態內容現代網站大量使用JavaScript動態加載數據評論列表更是如此。直接請求網頁URL得到的HTML可能不包含評論數據。我們需要分析瀏覽器與服務器之間的真實數據交互。使用瀏覽器開發者工具分析網絡請求打開華為應用市場某個應用的評論頁面如https://appgallery.huawei.com/app/C10123456?tabreview。按F12打開開發者工具切換到Network網絡選項卡。刷新頁面并滾動評論列表觸發加載更多。在請求列表中過濾XHR或Fetch類型的請求尋找返回評論數據的請求。通常其響應體是JSON格式。模擬API請求 假設我們找到了一個類似https://web-drcn.hispace.dbankcloud.cn/uowap/index?methodinternal.getTabDetailuriapp|C10123456tabKeyreviewpage1的接口它返回了JSON格式的評論數據。那么parse_comments方法就需要重寫不再解析HTML而是直接請求這個API接口并處理JSON響應。# 修改或重寫 parse_comments 方法 def parse_comments(self, response): app_id response.meta[app_id] # 如果當前響應是HTML頁面我們需要從中提取API的URL構造參數。 # 但更常見的做法是直接在 parse_category 中構造API請求。 # 更好的做法在 parse_category 中直接構造API請求 # 在 parse_category 方法里找到應用后 comment_api_template “https://web-drcn.hispace.dbankcloud.cn/uowap/index?methodinternal.getTabDetailuriapp|{app_id}tabKeyreviewpage{page}” first_comment_page_url comment_api_template.format(app_iditem[‘app_id’], page1) yield scrapy.Request(first_comment_page_url, callbackself.parse_comment_api, meta{‘app_id’: item[‘app_id’], ‘page’: 1}) def parse_comment_api(self, response): “””解析評論API返回的JSON數據。””” app_id response.meta[‘app_id’] current_page response.meta[‘page’] try: data response.json() # 解析JSON結構提取評論列表 comment_list data.get(‘list’, []) # 具體字段名需要根據實際API響應確定 if not comment_list: # 如果當前頁沒有數據說明已爬完 self.logger.info(f‘App {app_id} comments finished at page {current_page}‘) return for comment in comment_list: item CommentItem() item[‘app_id’] app_id item[‘comment_id’] comment.get(‘commentId’) item[‘user_name’] comment.get(‘userName’, ‘匿名用戶’) item[‘user_rating’] comment.get(‘score’, 5) # 假設5分制 item[‘comment_text’] comment.get(‘content’, ‘’).strip() item[‘comment_time’] comment.get(‘publishTime’) # 可能是時間戳 item[‘thumbs_up’] comment.get(‘praiseCount’, 0) yield item # 請求下一頁 next_page current_page 1 next_page_url response.url.replace(f’page{current_page}‘, f’page{next_page}‘) # 或者根據API返回的totalPage等信息判斷是否還有下一頁 # if current_page data.get(‘totalPage’, 1): yield scrapy.Request(next_page_url, callbackself.parse_comment_api, meta{‘app_id’: app_id, ‘page’: next_page}) except json.JSONDecodeError as e: self.logger.error(f‘Failed to parse JSON for {response.url}: {e}‘)重要提示上述API URL、參數名method,uri,tabKey以及JSON結構中的字段名list,commentId,score等均為示例并非華為應用市場的真實接口。你必須使用瀏覽器開發者工具親自分析目標網站的真實請求找到正確的接口地址和參數格式。這是爬蟲開發中最關鍵的一步。4. 應對反爬策略與提升穩定性商業網站通常沒有反爬機制。直接按上述步驟爬取很快可能會遇到請求失敗、返回空數據甚至IP被封的情況。4.1 中間件增強User-Agent與代理我們已經配置了隨機User-Agent。對于IP封鎖可以考慮使用代理IP池。這里以使用中間件集成代理為例。在middlewares.py中自定義一個代理中間件# huawei_appmarket/middlewares.py import random class RandomProxyMiddleware: def __init__(self, proxy_list): self.proxy_list proxy_list classmethod def from_crawler(cls, crawler): # 從settings或外部文件讀取代理列表 proxy_list crawler.settings.get(PROXY_LIST, []) # 或者從文件讀取proxy_list [line.strip() for line in open(proxies.txt)] return cls(proxy_list) def process_request(self, request, spider): if self.proxy_list and not request.meta.get(proxy): proxy random.choice(self.proxy_list) request.meta[proxy] proxy spider.logger.debug(fUsing proxy: {proxy}) # 在 settings.py 中啟用這個中間件并配置代理列表 DOWNLOADER_MIDDLEWARES { scrapy.downloadermiddlewares.useragent.UserAgentMiddleware: None, scrapy_user_agents.middlewares.RandomUserAgentMiddleware: 400, huawei_appmarket.middlewares.RandomProxyMiddleware: 750, # 數字代表優先級 } # PROXY_LIST [http://ip1:port, http://ip2:port, ...]4.2 請求頭與Cookie模擬有些API會校驗Referer,Origin等請求頭。我們需要在請求中模擬瀏覽器。# 在生成Request時添加headers headers { ‘Accept’: ‘application/json, text/javascript, */*; q0.01’, ‘Accept-Language’: ‘zh-CN,zh;q0.9,en;q0.8’, ‘Referer’: ‘https://appgallery.huawei.com/’, # 設置合適的來源頁 ‘X-Requested-With’: ‘XMLHttpRequest’, # 如果是Ajax請求 } yield scrapy.Request(url, callbackself.parse_comment_api, headersheaders, metameta)對于需要登錄后才能查看的評論雖然華為應用市場評論通常公開可能需要處理Cookie。可以使用scrapy.Request的cookies參數或者使用start_requests方法先發起一個登錄請求獲取Cookie。4.3 錯誤重試與速率控制Scrapy內置了重試中間件和自動限速擴展AutoThrottle合理配置它們能極大提升爬蟲的健壯性。# settings.py # 啟用并配置重試 RETRY_ENABLED True RETRY_TIMES 3 # 重試次數 RETRY_HTTP_CODES [500, 502, 503, 504, 408, 429] # 需要重試的HTTP狀態碼 # 啟用自動限速擴展它會根據服務器響應和負載自動調整請求延遲 AUTOTHROTTLE_ENABLED True AUTOTHROTTLE_START_DELAY 1.0 # 初始延遲 AUTOTHROTTLE_MAX_DELAY 60.0 # 最大延遲 AUTOTHROTTLE_TARGET_CONCURRENCY 4.0 # 目標平均并發數5. 數據存儲與后處理管道爬取到的數據需要持久化存儲。Scrapy的Pipeline組件非常適合做這件事。5.1 實現數據存儲Pipeline我們以存儲到MongoDB和JSON文件為例實現一個Pipeline。# huawei_appmarket/pipelines.py import json import pymongo from itemadapter import ItemAdapter from scrapy.exceptions import DropItem class HuaweiAppmarketPipeline: def __init__(self, mongo_uri, mongo_db): self.mongo_uri mongo_uri self.mongo_db mongo_db classmethod def from_crawler(cls, crawler): # 從settings讀取MongoDB配置 return cls( mongo_uricrawler.settings.get(MONGO_URI, mongodb://localhost:27017), mongo_dbcrawler.settings.get(MONGO_DATABASE, huawei_appmarket) ) def open_spider(self, spider): # 爬蟲啟動時連接數據庫 self.client pymongo.MongoClient(self.mongo_uri) self.db self.client[self.mongo_db] # 也可以同時打開一個JSON文件 self.json_file open(comments.json, a, encodingutf-8) def close_spider(self, spider): # 爬蟲關閉時斷開連接關閉文件 self.client.close() self.json_file.close() def process_item(self, item, spider): # 決定存儲到哪個集合/表 adapter ItemAdapter(item) if comment_text in adapter: # 判斷是否為CommentItem collection_name comments # 存儲到MongoDB self.db[collection_name].insert_one(dict(adapter)) # 同時寫入JSON文件一行一個JSON對象 line json.dumps(dict(adapter), ensure_asciiFalse) \n self.json_file.write(line) elif app_name in adapter: # 判斷是否為AppItem collection_name apps self.db[collection_name].update_one( {app_id: adapter[app_id]}, {$set: dict(adapter)}, upsertTrue # 如果不存在則插入 ) return item在settings.py中啟用這個Pipeline并配置MongoDB連接字符串。ITEM_PIPELINES { huawei_appmarket.pipelines.HuaweiAppmarketPipeline: 300, } MONGO_URI mongodb://localhost:27017 MONGO_DATABASE huawei_appmarket5.2 數據清洗與去重在Pipeline中我們還可以加入數據清洗邏輯比如去除空評論、過濾廣告、統一時間格式等。def process_item(self, item, spider): adapter ItemAdapter(item) # 清洗評論數據 if comment_text in adapter: text adapter.get(comment_text, ) # 去除空白字符 text text.strip() # 過濾掉過短或無意義的評論如“.”“好” if len(text) 2: raise DropItem(f“Dropped short comment: {text}”) adapter[comment_text] text # 時間格式轉換假設原始是時間戳 raw_time adapter.get(comment_time) if raw_time and isinstance(raw_time, (int, float)): # 轉換為可讀的ISO格式字符串 import datetime adapter[comment_time] datetime.datetime.fromtimestamp(raw_time/1000).isoformat() # ... 后續存儲邏輯6. 運行、監控與問題排查6.1 運行爬蟲可以使用Scrapy命令行運行特定的爬蟲。# 運行應用列表爬蟲如果拆分了的話 scrapy crawl app_list -o apps.json # 或者運行一個集成了所有邏輯的主爬蟲 scrapy crawl main_spider -s LOG_FILEspider.log為了長時間穩定運行并記錄日志建議使用nohup或screen等工具在后臺運行。nohup scrapy crawl main_spider crawl.log 21 6.2 常見問題與排查技巧在爬取過程中你幾乎一定會遇到下面這些問題。這是我的實戰記錄問題現象可能原因排查與解決思路返回HTTP 403/429錯誤IP或請求頻率被限制1. 檢查DOWNLOAD_DELAY和CONCURRENT_REQUESTS調大延遲降低并發。2. 檢查代理IP是否有效、是否被目標網站封禁。3. 檢查請求頭特別是User-Agent是否模擬到位。API請求返回空數據或錯誤JSON參數不正確或接口已更新1. 使用scrapy shell ‘api_url’直接測試請求查看原始響應。2. 用瀏覽器開發者工具對比你的請求和瀏覽器請求的所有細節包括URL參數、Headers尤其是Cookie和某些特定Token。3. 檢查是否需要處理頁面上的動態Token如csrf_token可能需要先請求一個頁面來獲取。爬取速度越來越慢最后停止觸發了更嚴格的風控1. 啟用AUTOTHROTTLE擴展讓它自動調節速度。2. 模擬更真實的行為隨機化請求間隔加入鼠標移動、滾動等行為的模擬可通過Selenium中間件實現但較重。3. 考慮使用更高質量的住宅代理IP。MongoDB連接失敗數據庫服務未啟動或配置錯誤1. 確認MongoDB服務正在運行 (systemctl status mongod或sudo service mongod status)。2. 檢查MONGO_URI是否正確包括IP、端口、認證信息如果有。內存使用持續增長可能發生了內存泄漏或Pipeline處理太慢1. 檢查Pipeline中是否有大量數據緩存未釋放。2. 適當降低CONCURRENT_ITEMSsettings中設置減少同時處理的Item數量。3. 使用scrapy stats命令查看爬蟲運行狀態關注item_scraped_count和memusage/startup。一個關鍵的調試技巧當爬蟲行為不符合預期時不要盲目修改代碼。首先在parse方法中使用self.logger.debug(f‘Response URL: {response.url}, Status: {response.status}’)打印關鍵信息。其次將出問題的響應體保存到本地文件方便仔細分析。def parse_comment_api(self, response): with open(‘debug_response.html’, ‘wb’) as f: f.write(response.body) # 然后暫停爬蟲用瀏覽器或文本編輯器打開這個文件分析。7. 項目優化與擴展思路當基礎爬蟲能穩定運行后可以考慮以下優化和擴展讓項目更專業、更強大。分布式爬取使用scrapy-redis組件將爬蟲改造成分布式利用多臺機器同時爬取速度可成倍提升。這對于“所有應用”這種海量目標非常有效。增量爬取不是每次都全量爬取。在Pipeline中記錄每條評論的爬取時間。下次運行時只請求和解析新出現的評論。這需要對API接口支持按時間篩選或者通過對比已存儲的最新評論ID來實現。數據豐富化除了評論還可以爬取應用的描述、更新日志、下載量、所屬開發者等信息構建更全面的應用畫像。情感分析與主題挖掘對爬取到的評論文本進行自然語言處理NLP例如使用snownlp或jiebasklearn進行情感分析正面/負面/中性或提取高頻關鍵詞了解用戶對應用的關注點和不滿之處。構建監控告警系統編寫一個簡單的腳本定期運行爬蟲的核心測試部分如訪問一個固定應用的評論頁檢查是否能正常獲取數據。如果連續失敗則通過郵件、釘釘機器人等方式發送告警。這個項目從表面看是一個標準的Scrapy爬蟲應用但深入其中你會涉及到HTTP協議、前端逆向、反爬對抗、數據清洗、異步編程、數據庫存儲乃至簡單的系統設計等多個方面的知識。每一個環節的深入都能帶來技術上的切實提升。我最初版本爬取10萬個評論花了近一天經過代理池、分布式和請求參數優化后時間縮短到了幾個小時。這個過程里最大的體會就是耐心分析網絡請求謹慎模擬瀏覽器行為尊重目標網站的服務器壓力是爬蟲項目能夠長期穩定運行的不二法門。希望這份詳細的實戰記錄能幫你少走彎路順利拿到你需要的數據。如果在實際操作中遇到新的具體問題比如某個特定的API參數怎么構造歡迎隨時交流討論。