Как настроить вп граббер

Как создать автонаполняемый сайт на вордпресс

Автонаполняемый сайт — вебресурс, который автоматически наполняется за счет контента с других сайтов. В целом автонаполнение сайта чужим контентом — это неправильно, но если несколько отодвинуть в сторону вопросы морали и авторского права, то остается большой сегмент контента, который можно копировать без больших угроз получить по голове: анонсы, новости, пресс-релизы.
На основе таких автонаполняемых новостей можно сделать как весь сайт целиком, так и отдельный раздел на существующем сайте. Например на сайте, посвященному боксу, сделать раздел спортивных новостей. А на сайте про актеров — новости из мира кино. За счет публикаций новостей можно попробовать ловить ситуативный трафик, с этих страниц можно торговать ссылками, с них можно проставлять перелинковку на свои продвигаемые страницы.

Как сделать автонаполняемый вордпресс-сайт с плагином wp-grabber

Для создания автонаполняемого проекта на понадобится готовый установленный сайт на вордпресс, сам плагин, настройка лент и немного терпения, потому как придется повозиться (потанцевать с бубном).

Вопрос — где взять плагин wp-grabber

Тут есть несколько вариантов:

  • купить доступ к плагину у разработчиков (поищите в гугле по запросу вп-граббер) — удовольствие примерно 250-500 рублей.
  • Зайдите на сайт складчин — и скачайте его там (снова гугл в помощь).
  • Можно попробовать скачать одну из таких версий здесь.

Как установить и настроить

Плагина нет в официальном репозитории, поэтому устанавливаем плагин через загрузку архива (панель управления — плагины — добавить новый — загрузить).

Далее активируете плагин и переходите в раздел раздел настроек.

И в настройках нужно будет только включить обновление через CRON.

Остальные настройки можно не трогать. Самое важное — правильно настроить ленты для граббинга и отображение публикаций на сайте.

Ниже представлены стандартные настройки для плагина WPGrabber

Теперь пройдемся по пунктам:

  • Для запросов использовать метод -> CURL (основная функция для парсинга контента)
  • Для скачивания файлов (картинок) использовать метод -> COPY (основная функция для грабинга и сохранения изображений)
  • Включить обработку редиректов -> Да
  • Максимальное время ожидания ответа от сервера -> 30 (вполне достаточно 30, пустое значение будет заменено на параметр из настроек вашего хостинга, сервера)
  • Каталог временных файлов -> /wp-content/wpgrabber_tmp/
  • Время выполнение основного процесса импорта в секундах -> 30 (вполне достаточно 30, пустое значение — по умолчанию: 30 сек.)
  • Разбивать процесс импорта на части -> Да
  • Сохраняем изменения

Как настроить ленты для граббинга

Это самая сложная часть, поэтому разберем ее подробнее. Бояться ошибиться не надо, если лента не заработала — просто возьмите другую. Наберитесь терпения и начнем.

Итак, идем в настройки вп-грабера и жмем добавить новую ленту — и видим несколько закладок. На будут нужны:

  1. Основные — это главные настройки получения контента.
  2. Контент — там выберем рубрики и схему публикации
  3. Картинки — записи с изображениями дают больше ПФ (поведенческих факторов)
  4. Вид — здесь пропишем шаблон поста
Читайте также:  Кто оплатит декретный отпуск если женщина не работает

Основные настройки — именно на них нужно обратить пристальное внимание.

  1. Наименование ленты — тут пишем чтобы вам было понятно или удобно, можно вставить просто урл сайта;
  2. Тип ленты — самые полные варианты удается спарсить при выборе html;
  3. Индексная страница — тут все понятно — пишем урл сайта;
  4. Кодировка страницы — смотрим кодировку, чаще встречается utf-8 и windows-1251. Для этого открываем код страницы ( в гугл хром, мозила файервокс и интернет эксплорер — это быстрые клавиши ctrl+u) — пример на картинке ниже;
  5. Определять анонс — на ваше усмотрение, рекомендую оставить «автоматически»;
  6. Самые главные пункты основной настройки — уделим им внимание несколько ниже: подробно разберем на примере какого-нибудь сайта;
  7. Ленту — включить.

Еще раз обратите внимание на то, как в исходном html-коде страницы указывается кодировка:

http-equiv =» Content-Type » content =» text/html; charset=ЗДЕСЬ КОДИРОВКА »/>

На некоторых сайтах кодировка не указана, тогда пробуйте значение: Исходная, или же WINDOWS-1251.

Подробней рассмотрим пункт 6 — Расписываем шаблоны ссылок, заголовка, стартовой и конечной точки контента.

Для начала разберем структуру ссылок, они бывают разные — в зависимости от CMS донора. Самые простые ссылки выглядят примерно так домен/слово, например http://seodelux.ru/portfolio

Какие могут быть варианты:

  • домен/слово
  • домен /слово
  • домен/цифры
  • домен/набор цифр и букв
  • домен/набор сложных символов
  • и более сложные композиции, сочетающие все варианты

Особое внимание обратите на правильное обозначение регулярных выражений.

Подбор шаблона ссылок

Рассмотрим на примере добавления одной ленты. Возьмем сайт новостей шоу-бизнеса starhit.ru

Первое что нужно понять — как выглядит ссылка в структуре сайта. Для этогоо идем на индексную страницу — смотрим ее код (ctrl+U) и через поиск по странице (ctrl+F) ишем заголовок и ссылку. Я просто начинаю искать в исходном коде через поиск начало заголовка. Смотрите на картинке выше.

У нас она получилась такого вида: /novosti/nastasya-samburskaya-ofitsialno-vyishla-zamuj-134191/

Так и будем вставлять ее в вп-граббер. Теперь нам необходимо заменить конкретный адрес на шаблон. Анализируем структуру: /раздел/несколько-слов-через-дефис-цифры. Проверим себя — посмотрим как выглядят другие ссылки. В нашем примере структура определена верно:

Посморим также другие разделы:

  • /style/kak-izbavit-rebenka-ot-internet-zavisimosti-134016/
  • /life/moe-telo-tyurma-kogda-pogonya-za-idealnyim-vesom-prevraschaetsya-v-bolezn-118797/
  • /photoistorii/anita-tsoy-vnov-brosila-vyizov-shou-biznesu-134162/
  • /eksklusiv/svadba-nikityi-presnyakova-i-alenyi-krasnovoy-eksklyuziv-foto-video-131883/

В регулярных выражениях PCRE любой непробельный символ обозначается следующей конструкцией \S

Обратите внимание на слэш \ перед заглавной буквой S. Обратный слэш в регулярных выражениях отменяет обычное действие символа, мы могли бы написать просто символ буквы S и тогда она была бы просто заглавной буквой S в нашем регулярном выражении. Однако \S — означает ровным образом один любой символ, кроме пробела!

Теперь попробуем указать количество символов в строке. количество символов задается такими регулярными выражениями:

  • \S <5>— пять любых смиволов
  • \S <9>— девять любых символов
  • \S <3,7>— от трех до 7 символов включительно.

И если с разделами еще можно угадать, просто посчитав число символов — новости (7 символов), стайл (5 символов), то вот с остальной частью ссылки — угадать сложно. Решение простое — нужно указать что число символов — больше 1. Выгдялеть регулярное выражение будет таким образом — \S

Можно и уточнить — в разделах у нас указаны только буквы, а одна буква в системе PCRE имеет обознаяение \w

Попробуем вставить в шаблон ссылок сдедующее выражение

В тесте получаем ссылки рабочие, но ненужные — на служебные страницы, например:

Меняем вторую часть шаблона. Буквы в регулярных выражениях обозначаются \w, а цифры — \d. Во второй части шаблона имеются и буквы и цифры, поэтому регулярное выражение мы можем задать как \w\d

Когда нам нужно в регулярном выражении перечислить вхождение разных символов (набора символов), то мы можем использовать квадратные скобки. Выражение получается вида:

Это означает: любая одна буква или одна цифра или более подобных символов.

Нам также нужно отсечь в первой части ненужные разделы, изменим там условие — минимальное число букв-5. Теперь давайте протестируем суммарно получившийся шаблон

Результат видим такой:

Значит шаблон ссылок правильный и теперь можно продолжать настройку. Еще раз напомню, что работа с регулярными выражаениями для простого вебмастера и блогера — наиболее сложный этап. Запомните основные переменные которые нам понадобятся:

\S \d \w плюс квадратные и фигурные скобки

Подбор шаблона заголовка

Для того чтобы WPGrabber нашел заголовок в тексте страницы определенной новости нам необходимо описать шаблон его поиска. Тут тоже используется формат регулярных выражений как и в описании шаблона ссылок.

Идем на страницу новости и смотрим еще раз ее исходный html-код. Копируем заголовок и с помощью ctrl+F ищем его на странице. Среди многообразия нам нужно найти наиболее подходящий вариант — без дополнительных слов и символов.

В нашем случае мы видим варианты:

  1. Настасья Самбурская официально вышла замуж | StarHit.ru
  2. property =» og:title » content =» Настасья Самбурская официально вышла замуж | StarHit.ru «>
  3. name =» twitter:title » content =» Настасья Самбурская официально вышла замуж «>

xmlns =» http://www.w3.org/1999/xhtml » class =» article-title » itemprop =» name «> Настасья Самбурская официально вышла замуж

Вот именно в этом примере я бы испольховал третий. Составляем шаблон, который будет состоять из трех частей: name =» twitter:title » content =» НАЗВАНИЕ «>

Тут нужно запомнить два правила:

  1. Круглые скобки обозначают выборку определенной части текста из строки name =» twitter:title » content =»(НАЗВАНИЕ)»>
  2. Конструкция вида: .*? вбирает (поглощает) в себя любое кол-во символов вплоть до встречи со следующим символом после нее.

Итого заменяем НАЗВАНИЕ в шаблоне на (.*?) и получаем следующую рабочую структуру, которую и протестируем:

WPGrabber теперь находит правильные заголовки:

Настройка начальной точки и конечной точки контента

Снова переходим на нашу страницу новости с исходным кодом и ишем начало текста и конец. Для этого снова можно воспользоваться поиском ctrl+F. Смотрим метатег, который есть перед началом текста и вставляем его в настройках плагина.

В нашем случае можно пробовать два варианта, я бы использовал то, который выделен красным цветом — метатег явно указывает на начало текстового контента:

Теперь смотрим метатег после текста статьи. В нашем случае подойдет тег

Тестируем и смотрим на результат: шаблон ссылки сработал, заголовок — корректный, есть текстовый и даже фото-контент.

Все первая и наиболее важная часть подготовки сделана.

Плюшки

Также вы можете получить готовые ленты тематики «игровые новости». Достаточно просто импортировать файл в плагине.

Важные настройки других параметров

Теперь когда основные нвстройки сделаны и вы по образцу сделали несколько лент, нужно приступить к настройкам контента, картинок и вида.

Начнем с последнего — закладка «Вид»

По умолчанию она отображается так:

В заголовке — название, которое мы берем из источника, затем полный текст. Для того чтобы у вас не было дубликатов с другими сайтами — с этим шаблоном нужно немного поработать. Справа указаны переменные, которые Вы можете смело использовать. Также никто не запрещает добавить свой контент.

Шаблон текста может выглядеть примерно так:

%INTRO_TEXT%
%NOW_DATE%
%INTRO_PIC%
%FULL_TEXT%
[шорткод — цвет фона]Специально для сайта НАЗВАНИЕ САЙТА новость %TITLE% взята с сайта %SOURCE_SITE% (Источник)[/конец шорткода]

Можно также добавить шорткод перелинковки или рекомендуемого контента между %INTRO_PIC% и %FULL_TEXT%.

Всё это сделает ваш текст отличающимся от других, а также установка ссылки на источник поможет избежать проблем с авторскими правами.

Теперь закладка «Картинки»

Настраиваем ее также как указано на картинке. Единственное, что можно поварьировать — это миниатюры и полноразмерные картинки установить в соответствии с темой оформления сайта.

Закладка «Контент»

За один запуск сохранять не более (записей) — тут решайте сами, я в основном ставлю 0 — неограничено.

Сохранять записи только уникальными (не повторяющимися) заголовками — ДА

Сохранять записи в Рубрике — тоже выбираете сами.

Тип — Запись

Автор записей — тут тоже решайте сам, я создаю специально пользователя с админскими доступами для автонаполняемых сайтов.

Статус создаваемых записей — опубликовано.

Для выделения анонса вставлять тег Далее — зависит от темы оформления.

Размер анонсовой части текст (кол-во символов) — на ваше усмотрение, обычно анонс — это 20-30 слов, то есть 500 — 600 знаков.

Конечный символ для отделения анонса — ставим точку.

Формировать постоянные ссылки для записей — Да

Метод генерации — транслитерация.

Размер алиаса — 0 (не обрезать)

Еще несколько рекомендаций для выживания сайта с плагином вп-граббер

  1. Добавляейте БОЛЬШОЕ количество лент. В автонаполняемом блоге должно быть 20-30 и более источников.
  2. Установите плагины:
    • Auto Featured Image from Title — создает миниатюры с текстом заголовка, пригодится когда граббер автоматом не может прочитать первую картинку в тексте.
    • SEO Friendly Images — автоматически прописывает в картинке метатег «alt».
    • Auto Tags Generator — автоматически генерирует метки вордпресс из названия.
    • Inline Related Posts — создает автоматическую перелинковку в теле поста.
    • New Adman — с его помощью можно добавить любой код или текст или картинку в тело поста.
  3. Создайте для автонаполняемого проекта страницы или группы в социальных сетях и делайте туда автоматические перепосты. Даже если группа имеет всего 10 подписчиков — это уже плюс. И положительный сигнал для поисковых систем.
  4. Закажите прогон по профилям, трастам или форумам. В крайнем случае купите несколько недорогих безанкорных ссылок.
  5. Заведите за правило, раз в месяц, заглядывать на сайт и проверять работоспособность лент и плагинов.

Другие работающие плагины для автонаполнения сайта на вордпресс

Я приведу ниже список плагинов, которые позволяют настроить автонаполнение сайта:

  • Syndicate Press
  • Push Syndication
  • FeedWordPress
  • Syndicate Out
  • CyberSyn
  • Wp-0-matic
  • WP RSS Aggregator
  • RSS AutoPilot
  • AUTOBLOG от WPMUDev
  • WordPress Automatic Plugin
  • WP Robot
  • WPeMatico

У каждого из этих плагины есть свои плюсы и минусы Одни — давно не обновлялись, другие стоят своих денег. Подробнее писать не буду из всех этих плагинов тестировал только Wp-О-matic.

Монетизация автонаполнемого сайта

Лучший способ монетизации таких проектов — это контекстная реклама. Установил и забыл, а копеечки капают.

Второй способ это продажа ссылок в автоматических биржах. Тут желательно поработать с ссылочным и получить хотя-бы тиц 10.

Пример: один средненький сайт с небольшой посещаемостью. Расходы в год — на домен 100 руб. (рекомендую 2domains.ru), на хостинг — 0 руб (Хотите узнать как — задайте вопрос в комментариях). Доход за год небольшой — около 12 долларов , но трафик минимально растет, сайт в индексе, перспективы хорошие. Значит и в дальнейшем он будет приносить небольшой, но пассивный доход.

Стоит ли создавать автонаполняемый сайт, вероятно — да. Это своеобразный задел на пенсию — понемногу, но стабильно. Если вы знаете другие способы монетизации — пишите в комментариях.

Источник

Оцените статью