搜索引擎收錄頁面實際上就是在互聯(lián)網上進行數據采集,這是搜索引擎最基礎的工作。搜索引擎的數據采集能力直接決定搜索引擎可提供的信息量及對互聯(lián)網覆蓋的范圍,從而決定搜索引擎的質量。因此,搜索引擎總是想方設計地提高其數據采集能力。
1.頁面收錄流程在互聯(lián)網中,URL是每個頁面的入口地址,搜索引擎蜘蛛程序就是通過URL抓取到頁面的。搜索引擎蜘蛛程序從URL列表出發(fā),通過URL抓取并存儲頁面;同時,提取原始頁面中的URL資源并加入到URL列表中。如此不斷地循環(huán),就可以從互聯(lián)網中獲取足夠多的頁面。
URL是頁面的入口,而域名則是網站的入口。搜索引擎蜘蛛程序通過域名進入網站,從而展開對網站頁面的抓取。換而言之,搜索引擎要在互聯(lián)網上抓取到頁面的首要任務就是建立一個足夠大的域名列表,再通過域名進入相應的網站,從而抓取網站中的頁面。
而對于網站來說,如果想要被搜索引擎收錄,首要條件就是加入搜索引擎的域名列表。下面向讀者介紹兩種常用的加入搜索引擎域名列表的方法。
第一,利用搜索引擎提供的網站登錄入口,向搜索引擎提交網站域名,例如Google的網站登錄地址是http://www.google.com/intl/zh-CN/add_url.html,可在此提交自己的網站域名。對于提交的域名列表,搜索引擎只會定期進行更新。因此,這種做法比較被動,從域名提交到網站被收錄花費的時間也比較長。
第二,通過與外部網站建立鏈接關系,使搜索引擎可以通過外部網站發(fā)現(xiàn)我們的網站,從而實現(xiàn)對網站的收錄。這種做法的主動權掌握在我們自己的手里(只要我們擁有足夠多高質量的鏈接即可),縣域收錄速度也比向搜索引擎主動提交要快得多。根據外部鏈接的數量、質量及相關性,一般情況下,2-7天左右就會被搜索引擎收錄。
2.頁面收錄原理通過上面的介紹,相信讀者已經掌握了網站被搜索引擎收錄的方法。然而,怎樣才能提高網站中頁面被收錄的數量呢?要回答這個問題,就要先了解搜索引擎收錄頁面的工作原理。
如果把網站頁面組成的集合看作是一個有向圖,從指定的頁面出發(fā),沿著頁面中的鏈接,按照某種特定的策略對網站中的頁面進行遍歷。不停地從URL列表中移出已經訪問過的URL,并存儲原始頁面,同時提取原始頁面中的URL信息;再將URL分為域名及部URL兩大類,同時判斷資源為止。經過這些工作,搜索引擎就可以建立龐大的域名列表、頁面URL列表并存儲足夠多的原始頁面。
3.頁面收錄方式上面已經介紹了搜索引擎收錄頁面的流程及原理。然而,在互聯(lián)網數以億計的頁面中,搜索引擎怎樣才能從中抓取到相對重要的頁面呢?這就是涉及搜索引擎的頁面收錄方式。
頁面收錄方式是指搜索引擎抓取頁面時所使用的策略,是為了能在互聯(lián)網中篩選出相對重要的信息。頁面收錄方式的制定取決于搜索引擎對網站結構的理解。如果使用相冊的抓取策略,搜索引擎在同樣的時間內可以在某一網站中抓取到更多的頁面資源,則會在該網站上停留更長的時間,收錄的頁面數自然也就更多。因此,加深對搜索引擎頁面收錄方式的認識,有利于為網站建立友好的結構,提高頁面被收錄的數量。
>>廣度優(yōu)先如果把整個網站看作是一棵樹,首頁就是根,每個頁面就是葉子。廣度優(yōu)先是一種橫向的頁面抓取方式,先從樹的較淺層開始抓取頁面,直至抓取完同層次的所有頁面后才進入下一層。因此,在對網站進行優(yōu)化時,我們應該把網站中相對重要的信息展示在層次較淺的頁面上(例如,在首頁上推薦一些熱門產品或者內容)。反過來,通過廣度優(yōu)先的抓取方式,搜索引擎就可以優(yōu)先抓取到網站中相對重要的頁面。
首先,搜索引擎從網站首頁出發(fā),抓取首頁上所有鏈接指向的頁面,形成頁面集合A,并解析出集合A中所有頁面的鏈接;再跟蹤這些鏈接抓取下一層的頁面,形成頁面集合B;就這樣遞歸地從線層頁面中解析出鏈接,從而抓取深層頁面,直至滿足了某個設定的條件才停止抓取進程。
>>深度優(yōu)先與廣度優(yōu)先的抓取方式相反,深度優(yōu)先首先跟蹤線層頁面中的某一鏈接逐步抓取深層頁面,直至抓取完最深層的頁面后才返回淺層頁面再跟蹤其另一鏈接,繼續(xù)向深層頁面抓取,這是一種頁面,這樣就能滿足更多用戶的需求。
當前題目:搜索引擎收錄原理
鏈接URL:http://jinyejixie.com/news1/136551.html
成都網站建設公司_創(chuàng)新互聯(lián),為您提供網站內鏈、用戶體驗、商城網站、網站建設、電子商務、外貿建站
廣告
聲明:本網站發(fā)布的內容(圖片、視頻和文字)以用戶投稿、用戶轉載內容為主,如果涉及侵權請盡快告知,我們將會在第一時間刪除。文章觀點不代表本網站立場,如需處理請聯(lián)系客服。電話:028-86922220;郵箱:631063699@qq.com。內容未經允許不得轉載,或轉載時需注明來源:
創(chuàng)新互聯(lián)