97免费在线观看视频 I 午夜夫妻视频 I 久久久久久网站 I 天堂网男人 I 欧美大波大乳人奶 I 丝袜 中出 制服 人妻 美腿 I 窝窝午夜理论片影院 I 日韩在线伦理电影 I 韩国特级毛片 I 亚洲欧美另类激情 I 在线成人日韩 I 麻豆视频免费看 I 黄色生活毛片 I 极品一线天小嫩嫩真紧 I 色久天堂 I 久久久久久黄色片 I 林智妍三级露全乳电影视频 I 大肉大捧一进一出好爽视频 I 空乘伦理hd I 少妇口述与子做过爱 I 成人免费影片 I 国产精品国内免费一区二区三区 I 日韩制服一区 I 青青草福利在线 I 日本在线观看不卡视频 I 婷婷六月综合亚洲 I 国产又粗又黄又硬 I 美女扒开屁股让男子桶爽 I 欧美性午夜视频观看 I 欧美狠狠插 I 亚洲福利在线观看视频 I 无码抽搐高潮喷水流白浆 I 亚洲欧美国产日韩色伦 I 你懂的视频网站在线观看 I www.蜜桃视频在线观看 I 日本无码人妻精品一区二区蜜桃 I 久久中文字幕人妻丝袜 I 碰草在线视频 I 日韩精品成人av网站

搜索引擎抓取系統概述

2013/10/10 15:34:36   閱讀:2410    發布者:2410

之前與大家分享了關于搜索引擎抓取系統中有關抓取系統基本框架、抓取中涉及的網絡協議、抓取的基本過程的內容,今天將于大家分享搜索引擎抓取系統第二部分內容—spider抓取過程中的策略。
spider在抓取過程中面對著復雜的網絡環境,為了使系統可以抓取到盡可能多的有價值資源并保持系統及實際環境中頁面的一致性同時不給網站體驗造成壓力,會設計多種復雜的抓取策略。以下簡單介紹一下抓取過程中涉及到的主要策略類型:
1、抓取友好性:抓取壓力調配降低對網站的訪問壓力
2、常用抓取返回碼示意
3、多種url重定向的識別
4、抓取優先級調配
5、重復url的過濾
6、暗網數據的獲取
7、抓取反作弊
8、提高抓取效率,高效利用帶寬
1、抓取友好性
互聯網資源龐大的數量級,這就要求抓取系統盡可能的高效利用帶寬,在有限的硬件和帶寬資源下盡可能多的抓取到有價值資源。這就造成了另一個問題,耗費被抓網站的帶寬造成訪問壓力,如果程度過大將直接影響被抓網站的正常用戶訪問行為。因此,在抓取過程中就要進行一定的抓取壓力控制,達到既不影響網站的正常用戶訪問又能盡量多的抓取到有價值資源的目的。
通常情況下,最基本的是基于ip的壓力控制。這是因為如果基于域名,可能存在一個域名對多個ip(很多大網站)或多個域名對應同一個ip(小網站共享ip)的問題。實際中,往往根據ip及域名的多種條件進行壓力調配控制。同時,站長平臺也推出了壓力反饋工具,站長可以人工調配對自己網站的抓取壓力,這時百度spider將優先按照站長的要求進行抓取壓力控制。
對同一個站點的抓取速度控制一般分為兩類:其一,一段時間內的抓取頻率;其二,一段時間內的抓取流量。同一站點不同的時間抓取速度也會不同,例如夜深人靜月黑風高時候抓取的可能就會快一些,也視具體站點類型而定,主要思想是錯開正常用戶訪問高峰,不斷的調整。對于不同站點,也需要不同的抓取速度。
2、常用抓取返回碼示意
簡單介紹幾種百度支持的返回碼:
1)  最常見的404代表“NOT FOUND”,認為網頁已經失效,通常將在庫中刪除,同時短期內如果spider再次發現這條url也不會抓取;
2)  503代表“Service Unavailable”,認為網頁臨時不可訪問,通常網站臨時關閉,帶寬有限等會產生這種情況。對于網頁返回503狀態碼,百度spider不會把這條url直接刪除,同時短期內將會反復訪問幾次,如果網頁已恢復,則正常抓取;如果繼續返回503,那么這條url仍會被認為是失效鏈接,從庫中刪除。
3)  403代表“Forbidden”,認為網頁目前禁止訪問。如果是新url,spider暫時不抓取,短期內同樣會反復訪問幾次;如果是已收錄url,不會直接刪除,短期內同樣反復訪問幾次。如果網頁正常訪問,則正常抓取;如果仍然禁止訪問,那么這條url也會被認為是失效鏈接,從庫中刪除。
4)301  代表是“Moved Permanently”,認為網頁重定向至新url。當遇到站點遷移、域名更換、站點改版的情況時,我們推薦使用301返回碼,同時使用站長平臺網站改版工具,以減少改版對網站流量造成的損失。
3、多種url重定向的識別
互聯網中一部分網頁因為各種各樣的原因存在url重定向狀態,為了對這部分資源正常抓取,就要求spider對url重定向進行識別判斷,同時防止作弊行為。重定向可分為三類:http 30x重定向、meta refresh重定向和js重定向。另外,百度也支持Canonical標簽,在效果上可以認為也是一種間接的重定向。
4、抓取優先級調配
由于互聯網資源規模的巨大以及迅速的變化,對于搜索引擎來說全部抓取到并合理的更新保持一致性幾乎是不可能的事情,因此這就要求抓取系統設計一套合理的抓取優先級調配策略。主要包括:深度優先遍歷策略、寬度優先遍歷策略、pr優先策略、反鏈策略、社會化分享指導策略等等。每個策略各有優劣,在實際情況中往往是多種策略結合使用以達到最優的抓取效果。
5、重復url的過濾
spider在抓取過程中需要判斷一個頁面是否已經抓取過了,如果還沒有抓取再進行抓取網頁的行為并放在已抓取網址集合中。判斷是否已經抓取其中涉及到最核心的是快速查找并對比,同時涉及到url歸一化識別,例如一個url中包含大量無效參數而實際是同一個頁面,這將視為同一個url來對待。
6、暗網數據的獲取
互聯網中存在著大量的搜索引擎暫時無法抓取到的數據,被稱為暗網數據。一方面,很多網站的大量數據是存在于網絡數據庫中,spider難以采用抓取網頁的方式獲得完整內容;另一方面,由于網絡環境、網站本身不符合規范、孤島等等問題,也會造成搜索引擎無法抓取。目前來說,對于暗網數據的獲取主要思路仍然是通過開放平臺采用數據提交的方式來解決,例如“百度站長平臺”“百度開放平臺”等等。
7、抓取反作弊
spider在抓取過程中往往會遇到所謂抓取黑洞或者面臨大量低質量頁面的困擾,這就要求抓取系統中同樣需要設計一套完善的抓取反作弊系統。例如分析url特征、分析頁面大小及內容、分析站點規模對應抓取規模等等。

 

主站蜘蛛池模板: 西西人体大胆扒开下部337卩 | 日日夜夜操视频 | 男人天堂视频在线观看 | 99999视频 | 99热这里只有精品国产免费免费 | 女同啪啪免费网站www | 饥渴的熟妇张开腿呻吟视频 | 高清不卡亚洲日韩av在线 | 中文字幕精品久久久乱码乱码 | 福利视频自拍 | 乱亲女h秽乱长久久久 | 91精品国产色综合久久不卡98最新章节 | 久久se精品一区二区三区 | 精品视频在线观看一区二区 | 国产aⅴ精品一区二区三区尤物 | 精品久久久久久乱码天堂 | 99精品国产一区二区电影 | 亚洲色av影院久久无码 | 四虎国产精品免费观看视频优播 | 激情毛片无码专区 | 亚洲精品手机在线观看 | 美女扒开腿让男人桶爽揉 | 欧美性猛交xxxx乱大交视频 | 亚洲操片 | 国产不卡在线播放 | 日本中文字幕乱码aa高清电影 | 天天看片天天操 | 亚洲另类伦春色综合小说 | 狠狠综合久久综合88亚洲 | 国产一区二区三区久久精品 | 精品无码国产污污污免费网站 | 高清破外女出血av毛片 | 午夜精品一区二区三区免费视频 | 亚洲精品无码久久千人斩 | 综合网久久 | 中文字幕在线播放视频 | 日韩视频网址 | 毛片在线免费 | a网站在线观看 | 成年免费视频播放网站推荐 | 玩两个丰满老熟女 | 在线天堂中文www官网 | 夜夜爱夜夜做夜夜爽 | 综合色网站 | 中文字幕精品亚洲无线码二区 | 国产精品久久久久久久av | 中文字幕久久波多野结衣av | 亚洲人成网址在线播放 | 日韩小视频在线 | 五月婷婷深爱 | 一区二区免费视频 | 成人国产欧美大片一区 | 尤物在线观看 | 亚洲一线二线三线品牌精华液久久久 | 色天使久久综合给合久久97色 | 国产在线精品一区在线观看 | 丰满迷人的少妇特级毛片 | 成人在线观看小视频 | 国产日韩av在线 | 污导航在线观看 | 日韩久久激情 | 亚洲精品久久久日韩美女图片 | 国产成人av不卡免费观看 | 少妇视频一区二区三区 | 日韩 欧美| 一级一片免费播放 | 妇女bbbb插插插视频 | 亚洲国产成人无码专区 | 日韩中文字幕亚洲 | 国产精品亚洲а∨无码播放麻豆 | 中国特级黄色大片 | 91精品国产综合久久久久 | 亚洲国产制服丝袜先锋 | 久久人人爽人人爽爽久久小说 | 国产白丝袜喷白浆毛片av | 91久久久久久亚洲精品禁果 | 蜜臀av在线无码国产 | 在线看片免费人成视频大全 | 91探花网站 | 美女视频黄免费 | 99免费观看 | 日韩在线一二三区 | 少妇被粗大的猛烈进出96影院 | 亚洲狠狠婷婷综合久久蜜芽 | 欧美日韩国产图片区一区 | 纯肉无遮挡h肉动漫在线观看国产 | 精品国产午夜理论片不卡 | 岛国激情视频 | 欧美精品成人久久 | 国产亚洲精品久久久网站好莱 | 国产日产欧产美韩系列影片 | 国产在线青青草 | 国产午夜亚洲精品午夜鲁丝片 | 欧美顶级metart裸体全部自慰 | 日本视频在线观看免费 | 国产福利视频在线观看 | 日韩免费一区二区三区 | 国产又白又嫩又爽又黄 | 久草com |