網絡爬蟲是一種按照一定的規則,自動地抓取萬維網信息的程序或者腳本 。另外一些不常使用的名字還有螞蟻、自動索引、模擬程序或者蠕蟲 。
網絡爬蟲是一個自動提取網頁的程序,它為搜索引擎從萬維網上下載網頁,是搜索引擎的重要組成 。傳統爬蟲從一個或若干初始網頁的URL開始,獲得初始網頁上的URL,在抓取網頁的過程中,不斷從當前頁面上抽取新的URL放入隊列,直到滿足系統的一定停止條件 。聚焦爬蟲的工作流程較為復雜,需要根據一定的網頁分析算法過濾與主題無關的鏈接,保留有用的鏈接并將其放入等待抓取的URL隊列 。然后,它將根據一定的搜索策略從隊列中選擇下一步要抓取的網頁URL,并重復上述過程,直到達到系統的某一條件時停止 。另外,所有被爬蟲抓取的網頁將會被系統存貯,進行一定的分析、過濾,并建立索引,以便之后的查詢和檢索;對于聚焦爬蟲來說,這一過程所得到的分析結果還可能對以后的抓取過程給出反饋和指導 。
【爬蟲技術是什么 爬蟲技術是什么時候開始的】
相關經驗推薦
- 華為手機右上角有個hd 華為手機左上角出現一個hd是什么
- 駱駝沖鋒衣三合一是什么意思 沖鋒衣三合一是什么意思
- others其他材料是什么材質 其它others是什么材料
- 核桃里的小黑蟲是什么蟲 核桃里的黑色蟲子是什么蟲
- 藏紅花種類及圖片大全 藏紅花是什么花圖片
- 香瓜種植技術與管理法 香瓜種植技術與管理法
- 骨粉是什么肥 骨粉是什么肥作用
- 黃金百香果種植 黃金百香果種植技術要領
- 叉尾魚的養殖技術 叉尾魚的養殖技術用藥
- 基圍蝦養殖技術條件 基圍蝦養殖技術條件條件
