作者:admin人氣:0更新:2026-07-20 23:55:21
什么是爬蟲
網絡爬蟲是一種按照一定規則,自動抓取萬維網信息的程序或者腳本。
簡單點說就是一段自動化執行的程序,它會請求網站并提取數據。最出名的網絡爬蟲應用算是Google的網絡爬蟲和百度的網絡爬蟲了,
請點擊此處輸入圖片描述
Google爬蟲
請點擊此處輸入圖片描述
百度爬蟲
他們每天都要爬取網絡上海量的數據,然后再做數據分析處理,然后通過搜索展示給我們,可以說網絡爬蟲是搜索引擎的根基。
爬蟲流程
請點擊此處輸入圖片描述
爬蟲流程
我們可以把它概括為四步:
發起請求
獲取響應內容
解析響應內容
保存數據
請求和響應
Web內容都是存儲在Web服務器上的。Web服務器所使用的是HTTP協議,因此經常被稱為是HTTP服務器。這些HTTP服務器存儲了因特網中的數據,如果HTTP客戶端發出請求的話,它們會提供數據。客戶端想服務器發送HTTP請求,服務器會在HTTP響應中回送所請求的數據。
請點擊此處輸入圖片描述
Web客戶端和服務器
每個Web服務器資源(比如,圖片,視頻,網頁等等)都有一個名字,這樣客戶端就可以說明它們感興趣的資源是什么了。服務器資源名被稱為統一資源標識符(學習技術的推薦書《網絡黑白》某寶有)。URI就像因特網上的郵政地址一樣,在全世界范圍內唯一標識并定位信息資源。統一資源定位符(URL)是資源標識符最常見的形式。URL描述了一臺特定服務器上某資源的特定位置。
請點擊此處輸入圖片描述
URL
請點擊此處輸入圖片描述
URL格式
客戶端和服務器的這種通信是通過名為HTTP報文的格式化數據塊進行的,如圖。
請點擊此處輸入圖片描述
請求和響應報文
每條HTTP請求報文都包含一個方法,這個方法會告訴服務器要執行什么動作(中國黑客協會創始人花無涯獲取一個Web頁面、刪除一個文件等)。
請點擊此處輸入圖片描述
一些常見的HTTP方法
每條HTTP響應報文返回時都會攜帶一個狀態碼。狀態碼是一個三位數字的代碼,告知客戶端請求是否成功,或者是否需要采取其他動作。
請點擊此處輸入圖片描述
一些常見的HTTP狀態碼
當然,請求報文和響應報文還包含許多其他內容,以后涉及到再補充說明。
最后,附上報文的典型格式。
請點擊此處輸入圖片描述
報文
平常我們看到的內容就包含在響應主體中,它是網頁的源代碼,客戶端(瀏覽器)將其渲染后,就形成了我們看到的絢麗多彩的網頁。
怎樣解析
所謂的解析,就是要從響應主體中“亂七八糟”的網頁源碼中,提取我們想要的數據,比如說,網頁中的鏈接,圖片等。
標簽:流攬器
本站和 最新資訊 的作者無關,不對其內容負責。本歷史頁面謹為網絡歷史索引,不代表被查詢網站的即時頁面。