<rt id="eeo40"><acronym id="eeo40"></acronym></rt>
  • <dd id="eeo40"><s id="eeo40"></s></dd>
  • <menu id="eeo40"><code id="eeo40"></code></menu>
  • 您的位置:首 頁 > 新聞中心 > 行業(yè)動態(tài) > 行業(yè)動態(tài)基于Heritrix的網(wǎng)絡爬蟲實現(xiàn)

    行業(yè)動態(tài)

    行業(yè)動態(tài)基于Heritrix的網(wǎng)絡爬蟲實現(xiàn)

    發(fā)布:2021-01-02 12:32:23 瀏覽:2252

            基于Heritrix的網(wǎng)絡爬蟲實現(xiàn)。

            網(wǎng)絡爬蟲, 是一種可以根據(jù)網(wǎng)頁之間的鏈接關系, 在Internet中自動抓取網(wǎng)頁的程序, 它可以有條理的, 自動的遍歷萬維網(wǎng)信息空間。它通過HTTP協(xié)議來訪問網(wǎng)頁, 同時, 通過跟蹤鏈接來遍歷整個Web空間。本系統(tǒng)的網(wǎng)絡爬蟲, 基于Heritrix實現(xiàn)。Heritrix是一個由Java開發(fā)的、開源的Web網(wǎng)絡爬蟲框架。

            本系統(tǒng)的網(wǎng)絡爬蟲為要包括:網(wǎng)頁分類器 (根據(jù)主題策略將網(wǎng)頁分為主題相關和主題不相關兩類) 、信息提取器 (以主題相關網(wǎng)頁作為提取對象, 提取文本信息和鏈接信息) 和網(wǎng)頁抓取器 (抓取“篩選”過的網(wǎng)頁) 。

    >>> 查看《行業(yè)動態(tài)基于Heritrix的網(wǎng)絡爬蟲實現(xiàn)》更多相關資訊 <<<

    本文地址:http://www.modelkey.org/news/html/22843.html

    趕快點擊我,讓我來幫您!
    亚洲高清无码中文成人在线,AV色综合久久天堂AV色综合在,久久人人爽人人爽人人片av高,日本亚洲成a人片在线观看
    <rt id="eeo40"><acronym id="eeo40"></acronym></rt>
  • <dd id="eeo40"><s id="eeo40"></s></dd>
  • <menu id="eeo40"><code id="eeo40"></code></menu>