Результаты поиска по запросу "nutch"
http://www.atlantbh.com/precise-data-extraction-with-apache-nutch/
аюсь использоватьApache Nutch v1.3 извлечь только некоторый конкретный контент из веб-страниц. Проверен плагин html parse. Кажется, это нормализует каждую html-страницу, используя tagsoup или nekohtml. Это хорошо. Мне нужно извлечь только текст ...
Попробуйте также указать имя агента для http.robots.agents. Это сработало для меня. Я не получил это сообщение после этого !!!
Exception in thread "main" java.lang.IllegalArgumentException: Fetcher: No agents listed in 'http.agent.name' property. at org.apache.nutch.fetcher.Fetcher.checkConfiguration(Fetcher.java:1166) ...
Это не совсем так. Solr анализирует объекты Lucene Document, которые создает Nutch. Часть данных - это необработанный HTML, но есть и другие свойства, такие как title и contentType, которые связаны с Solr. Солр не разбирает это.
нирую наш большой веб-сайт (ы) с помощью Nutch, а затем индексирую с помощью Solr, и результаты довольно хорошие. Однако на сайте есть несколько структур меню, которые индексируют и портят результаты запроса. Каждое из этих меню четко определено ...
Да, есть способ. Взгляните на cache.jsp, чтобы увидеть, как он отображает кэшированные данные.
ли способ получить html-содержимое каждой веб-страницы во время сканирования веб-страницы?
Не все сайты имеют «If-Modified-Since». Посмотрите на «Last-Modified», чтобы помочь.
рабатываю систему, которая должна отслеживать содержимое нескольких порталов и проверять изменения каждую ночь (например, загружать и индексировать новые сайты, которые были добавлены в течение дня). Содержимое этих порталов ...
Это неправда. Ларсман дает хороший ответ. если google.com ссылается на google.com/service/contact/phone, то это будет глубина 1, а не 3, как вы говорите.
отаю на гусеничном шасси и мне нужно точно понять, что подразумевается под "глубиной ссылки". Возьмите орех, например:http://wiki.apache.org/nutch/...
Использование Nutch Crawler с Solr
Могу ли я интегрировать сканер Apache Nutch с сервером Solr Index? Редактировать: Один из наших разработчиков придумал решение из этих постов Бег Nutch и Solr [http://wiki.apache.org/nutch/RunningNutchAndSolr]Обновление для Запуск Nutch и ...
Страница 2 из 2