java爬蟲（java爬蟲和python爬蟲）

本文目錄一覽：

1、java爬蟲非同步載入數據怎麼解決
2、java 網路爬蟲怎麼實現
3、java適合寫爬蟲嗎？
4、java爬蟲長時間無返回
5、java爬蟲抓取指定數據
6、java爬蟲代理如何實現

java爬蟲非同步載入數據怎麼解決

給題主兩種思路參考：

1、內置一個瀏覽器內核

內置瀏覽器就是在抓取的程序中，啟動一個瀏覽器內核，使我們獲取到 js 渲染後的頁面，這樣我們就跟採集靜態頁面一樣了。這種工具常用的有以下三種： – Selenium – HtmlUnit – PhantomJs

這些工具都能幫助我們解決數據非同步載入的問題，但是他們都存在缺陷，那就是效率不高而且不穩定。

2、反向解析法

什麼是反向解析法呢？我們 js 渲染頁面的數據是通過 Ajax 的方式從後端獲取的，我們只需要找到對應的 Ajax 請求連接就 OK，這樣我們就獲取到了我們需要的數據，反向解析法的好處就是這種方式獲取的數據都是 json 格式的數據，解析起來也比較方便，另一個好處就是相對頁面來說，介面的變化概率更小。同樣它有兩個不足之處，一個是在 Ajax 時你需要有耐心有技巧，因為你需要在一大推請求中找到你想要的，另一個不足的地方就是對 JavaScript 渲染的頁面束手無策。

java 網路爬蟲怎麼實現

網路爬蟲是一個自動提取網頁的程序，它為搜索引擎從萬維網上下載網頁，是搜索引擎的重要組成。

傳統爬蟲從一個或若干初始網頁的URL開始，獲得初始網頁上的URL，在抓取網頁的過程中，不斷從當前頁面上抽取新的URL放入隊列，直到滿足系統的一定停止條件。對於垂直搜索來說，聚焦爬蟲，即有針對性地爬取特定主題網頁的爬蟲，更為適合。

以下是一個使用java實現的簡單爬蟲核心代碼：

public void crawl() throws Throwable {

while (continueCrawling()) {

CrawlerUrl url = getNextUrl(); //獲取待爬取隊列中的下一個URL

if (url != null) {

printCrawlInfo();

String content = getContent(url); //獲取URL的文本信息

//聚焦爬蟲只爬取與主題內容相關的網頁，這裡採用正則匹配簡單處理

if (isContentRelevant(content, this.regexpSearchPattern)) {

saveContent(url, content); //保存網頁至本地

//獲取網頁內容中的鏈接，並放入待爬取隊列中

Collection urlStrings = extractUrls(content, url);

addUrlsToUrlQueue(url, urlStrings);

} else {

System.out.println(url + ” is not relevant ignoring …”);

}

//延時防止被對方屏蔽

Thread.sleep(this.delayBetweenUrls);

}

closeOutputStream();

}

private CrawlerUrl getNextUrl() throws Throwable {

CrawlerUrl nextUrl = null;

while ((nextUrl == null) (!urlQueue.isEmpty())) {

CrawlerUrl crawlerUrl = this.urlQueue.remove();

//doWeHavePermissionToVisit：是否有許可權訪問該URL，友好的爬蟲會根據網站提供的”Robot.txt”中配置的規則進行爬取

//isUrlAlreadyVisited：URL是否訪問過，大型的搜索引擎往往採用BloomFilter進行排重，這裡簡單使用HashMap

//isDepthAcceptable：是否達到指定的深度上限。爬蟲一般採取廣度優先的方式。一些網站會構建爬蟲陷阱（自動生成一些無效鏈接使爬蟲陷入死循環），採用深度限制加以避免

if (doWeHavePermissionToVisit(crawlerUrl)

(!isUrlAlreadyVisited(crawlerUrl))

isDepthAcceptable(crawlerUrl)) {

nextUrl = crawlerUrl;

// System.out.println(“Next url to be visited is ” + nextUrl);

}

return nextUrl;

}

private String getContent(CrawlerUrl url) throws Throwable {

//HttpClient4.1的調用與之前的方式不同

HttpClient client = new DefaultHttpClient();

HttpGet httpGet = new HttpGet(url.getUrlString());

StringBuffer strBuf = new StringBuffer();

HttpResponse response = client.execute(httpGet);

if (HttpStatus.SC_OK == response.getStatusLine().getStatusCode()) {

HttpEntity entity = response.getEntity();

if (entity != null) {

BufferedReader reader = new BufferedReader(

new InputStreamReader(entity.getContent(), “UTF-8”));

String line = null;

if (entity.getContentLength() 0) {

strBuf = new StringBuffer((int) entity.getContentLength());

while ((line = reader.readLine()) != null) {

strBuf.append(line);

}

if (entity != null) {

nsumeContent();

}

//將url標記為已訪問

markUrlAsVisited(url);

return strBuf.toString();

}

public static boolean isContentRelevant(String content,

Pattern regexpPattern) {

boolean retValue = false;

if (content != null) {

//是否符合正則表達式的條件

Matcher m = regexpPattern.matcher(content.toLowerCase());

retValue = m.find();

}

return retValue;

}

public List extractUrls(String text, CrawlerUrl crawlerUrl) {

Map urlMap = new HashMap();

extractHttpUrls(urlMap, text);

extractRelativeUrls(urlMap, text, crawlerUrl);

return new ArrayList(urlMap.keySet());

}

private void extractHttpUrls(Map urlMap, String text) {

Matcher m = (text);

while (m.find()) {

String url = m.group();

String[] terms = url.split(“a href=\””);

for (String term : terms) {

// System.out.println(“Term = ” + term);

if (term.startsWith(“http”)) {

int index = term.indexOf(“\””);

if (index 0) {

term = term.substring(0, index);

}

urlMap.put(term, term);

System.out.println(“Hyperlink: ” + term);

}

private void extractRelativeUrls(Map urlMap, String text,

CrawlerUrl crawlerUrl) {

Matcher m = relativeRegexp.matcher(text);

URL textURL = crawlerUrl.getURL();

String host = textURL.getHost();

while (m.find()) {

String url = m.group();

String[] terms = url.split(“a href=\””);

for (String term : terms) {

if (term.startsWith(“/”)) {

int index = term.indexOf(“\””);

if (index 0) {

term = term.substring(0, index);

}

String s = //” + host + term;

urlMap.put(s, s);

System.out.println(“Relative url: ” + s);

}

public static void main(String[] args) {

try {

String url = “”;

Queue urlQueue = new LinkedList();

String regexp = “java”;

urlQueue.add(new CrawlerUrl(url, 0));

NaiveCrawler crawler = new NaiveCrawler(urlQueue, 100, 5, 1000L,

regexp);

// boolean allowCrawl = crawler.areWeAllowedToVisit(url);

// System.out.println(“Allowed to crawl: ” + url + ” ” +

// allowCrawl);

crawler.crawl();

} catch (Throwable t) {

System.out.println(t.toString());

t.printStackTrace();

}

java適合寫爬蟲嗎？

JAVA也可以實現爬蟲，比如jsoup包，一個非常方便解析html的工具呢。

不過相對來說，java語言笨重，稍微有些麻煩。

java爬蟲長時間無返回

可能是代碼異常。

寫代碼總是會出異常的，尤其是爬蟲這類程序，無法確保每次請求都能穩定地返回統一的結果，比如反爬蟲策略提升代理IP超時程序異常等等，處理好這些問題，才能保證爬蟲程序持續地運行下去，反爬蟲策略，超時設置網路總是不會一如既往的穩定如一，可能代理IP某個時間不穩定，也可能目標伺服器某個時間不穩定，還有自身機器的網路也可能不穩定，如果不設置好超時，程序也不好跑下去。

java爬蟲抓取指定數據

根據java網路編程相關的內容，使用jdk提供的相關類可以得到url對應網頁的html頁面代碼。

針對得到的html代碼，通過使用正則表達式即可得到我們想要的內容。

比如，我們如果想得到一個網頁上所有包括「java」關鍵字的文本內容，就可以逐行對網頁代碼進行正則表達式的匹配。最後達到去除html標籤和不相關的內容，只得到包括「java」這個關鍵字的內容的效果。

從網頁上爬取圖片的流程和爬取內容的流程基本相同，但是爬取圖片的步驟會多一步。

需要先用img標籤的正則表達式匹配獲取到img標籤，再用src屬性的正則表達式獲取這個img標籤中的src屬性的圖片url，然後再通過緩衝輸入流對象讀取到這個圖片url的圖片信息，配合文件輸出流將讀到的圖片信息寫入到本地即可。

java爬蟲代理如何實現

無論是使用java、Python爬取數據，都會出現IP被封的情況，所以就需要使用代理IP替我們操作。我一般會利用Java的HttpClient包，來加入動態代理功能，我使用的是芝麻HTTP代理，當然你也可以選擇其他的代理提供商。

1、先聲明一個代理類

2、聲明一個HttpClient 對象，設置好超時時間

3、設置芝麻HTTP代理

4、測試當前的代理是否有用

5、得到伺服器是否對我們進行屏蔽，如果返回的是SC_FORBIDDEN，代表被屏蔽的，那麼我們就一個一個代理去試，也就是調用第四步的函數去判斷當前的代理是否有用

原創文章，作者：小藍，如若轉載，請註明出處：https://www.506064.com/zh-tw/n/153871.html

java爬蟲（java爬蟲和python爬蟲）

本文目錄一覽：

java爬蟲 非同步載入數據怎麼解決

java 網路爬蟲怎麼實現

java適合寫爬蟲嗎？

java爬蟲 長時間無返回

java爬蟲抓取指定數據

java爬蟲代理如何實現

相關推薦

發表回復

java爬蟲非同步載入數據怎麼解決

java爬蟲長時間無返回