Wpgrabber как настроить ленту

WPGrabber — автопарсер для wordpress

Перевод Яндекс, Google, Deepl Translate. Теги. Даты поста донора. Импорт из VK по API. Работа через список proxy. Имена файлов картинок из заголовка.

Настройка лент WPGrabber, плагин для wordpress

  • Получить ссылку
  • Facebook
  • Twitter
  • Pinterest
  • Электронная почта
  • Другие приложения

>>> Заказать настройки лент

>>> Купить WPGrabber

Благодаря гибким настройкам обработки автоматически удаляются ненужные блоки информации, ссылки и картинки. Ограничение захвата картинок.
Умеет работать через PROXY (PROXY_HTTP, SOCKS5, SOCKS4A), с авторизацией.
Парсить метки (tags) со страницы или из файла.

Возможность перевода импортируемого контента на лету с помощью API:

  • Яндекс.ПереводчикБесплатный
  • Google ПереводчикБесплатный
  • Google CloudTranslation API v2
  • Яндекс.ОблакоTranslate API
  • Яндекс.Перевод (устарел)

Поддерживает режим автоматической работы обновления с другими сайтами.

  • Работает без ограничений – собирает тексты с (почти) любого количества сайтов.
  • Нет никаких привязок к домену, серверу или лицензии

Настройка плагина WPGrabber включает автообновление, CRON-задание, порядок и периоды обновления лент, интервал запуска процессов, устранение неполадок и многое другое.

Плагин полностью совместим с WordPress 5.6.1 и предыдущими версиями движка. Поддержка PHP 7.4

Источник

Как создать автонаполняемый сайт на вордпресс

Автонаполняемый сайт — вебресурс, который автоматически наполняется за счет контента с других сайтов. В целом автонаполнение сайта чужим контентом — это неправильно, но если несколько отодвинуть в сторону вопросы морали и авторского права, то остается большой сегмент контента, который можно копировать без больших угроз получить по голове: анонсы, новости, пресс-релизы.
На основе таких автонаполняемых новостей можно сделать как весь сайт целиком, так и отдельный раздел на существующем сайте. Например на сайте, посвященному боксу, сделать раздел спортивных новостей. А на сайте про актеров — новости из мира кино. За счет публикаций новостей можно попробовать ловить ситуативный трафик, с этих страниц можно торговать ссылками, с них можно проставлять перелинковку на свои продвигаемые страницы.

Как сделать автонаполняемый вордпресс-сайт с плагином wp-grabber

Для создания автонаполняемого проекта на понадобится готовый установленный сайт на вордпресс, сам плагин, настройка лент и немного терпения, потому как придется повозиться (потанцевать с бубном).

Вопрос — где взять плагин wp-grabber

Тут есть несколько вариантов:

  • купить доступ к плагину у разработчиков (поищите в гугле по запросу вп-граббер) — удовольствие примерно 250-500 рублей.
  • Зайдите на сайт складчин — и скачайте его там (снова гугл в помощь).
  • Можно попробовать скачать одну из таких версий здесь.

Как установить и настроить

Плагина нет в официальном репозитории, поэтому устанавливаем плагин через загрузку архива (панель управления — плагины — добавить новый — загрузить).

Далее активируете плагин и переходите в раздел раздел настроек.

И в настройках нужно будет только включить обновление через CRON.

Остальные настройки можно не трогать. Самое важное — правильно настроить ленты для граббинга и отображение публикаций на сайте.

Ниже представлены стандартные настройки для плагина WPGrabber

Теперь пройдемся по пунктам:

  • Для запросов использовать метод -> CURL (основная функция для парсинга контента)
  • Для скачивания файлов (картинок) использовать метод -> COPY (основная функция для грабинга и сохранения изображений)
  • Включить обработку редиректов -> Да
  • Максимальное время ожидания ответа от сервера -> 30 (вполне достаточно 30, пустое значение будет заменено на параметр из настроек вашего хостинга, сервера)
  • Каталог временных файлов -> /wp-content/wpgrabber_tmp/
  • Время выполнение основного процесса импорта в секундах -> 30 (вполне достаточно 30, пустое значение — по умолчанию: 30 сек.)
  • Разбивать процесс импорта на части -> Да
  • Сохраняем изменения
Читайте также:  Починить сломанную кнопку клавиатуры

Как настроить ленты для граббинга

Это самая сложная часть, поэтому разберем ее подробнее. Бояться ошибиться не надо, если лента не заработала — просто возьмите другую. Наберитесь терпения и начнем.

Итак, идем в настройки вп-грабера и жмем добавить новую ленту — и видим несколько закладок. На будут нужны:

  1. Основные — это главные настройки получения контента.
  2. Контент — там выберем рубрики и схему публикации
  3. Картинки — записи с изображениями дают больше ПФ (поведенческих факторов)
  4. Вид — здесь пропишем шаблон поста

Основные настройки — именно на них нужно обратить пристальное внимание.

  1. Наименование ленты — тут пишем чтобы вам было понятно или удобно, можно вставить просто урл сайта;
  2. Тип ленты — самые полные варианты удается спарсить при выборе html;
  3. Индексная страница — тут все понятно — пишем урл сайта;
  4. Кодировка страницы — смотрим кодировку, чаще встречается utf-8 и windows-1251. Для этого открываем код страницы ( в гугл хром, мозила файервокс и интернет эксплорер — это быстрые клавиши ctrl+u) — пример на картинке ниже;
  5. Определять анонс — на ваше усмотрение, рекомендую оставить «автоматически»;
  6. Самые главные пункты основной настройки — уделим им внимание несколько ниже: подробно разберем на примере какого-нибудь сайта;
  7. Ленту — включить.

Еще раз обратите внимание на то, как в исходном html-коде страницы указывается кодировка:

http-equiv =» Content-Type » content =» text/html; charset=ЗДЕСЬ КОДИРОВКА »/>

На некоторых сайтах кодировка не указана, тогда пробуйте значение: Исходная, или же WINDOWS-1251.

Подробней рассмотрим пункт 6 — Расписываем шаблоны ссылок, заголовка, стартовой и конечной точки контента.

Для начала разберем структуру ссылок, они бывают разные — в зависимости от CMS донора. Самые простые ссылки выглядят примерно так домен/слово, например http://seodelux.ru/portfolio

Какие могут быть варианты:

  • домен/слово
  • домен /слово
  • домен/цифры
  • домен/набор цифр и букв
  • домен/набор сложных символов
  • и более сложные композиции, сочетающие все варианты

Особое внимание обратите на правильное обозначение регулярных выражений.

Подбор шаблона ссылок

Рассмотрим на примере добавления одной ленты. Возьмем сайт новостей шоу-бизнеса starhit.ru

Первое что нужно понять — как выглядит ссылка в структуре сайта. Для этогоо идем на индексную страницу — смотрим ее код (ctrl+U) и через поиск по странице (ctrl+F) ишем заголовок и ссылку. Я просто начинаю искать в исходном коде через поиск начало заголовка. Смотрите на картинке выше.

У нас она получилась такого вида: /novosti/nastasya-samburskaya-ofitsialno-vyishla-zamuj-134191/

Так и будем вставлять ее в вп-граббер. Теперь нам необходимо заменить конкретный адрес на шаблон. Анализируем структуру: /раздел/несколько-слов-через-дефис-цифры. Проверим себя — посмотрим как выглядят другие ссылки. В нашем примере структура определена верно:

Посморим также другие разделы:

  • /style/kak-izbavit-rebenka-ot-internet-zavisimosti-134016/
  • /life/moe-telo-tyurma-kogda-pogonya-za-idealnyim-vesom-prevraschaetsya-v-bolezn-118797/
  • /photoistorii/anita-tsoy-vnov-brosila-vyizov-shou-biznesu-134162/
  • /eksklusiv/svadba-nikityi-presnyakova-i-alenyi-krasnovoy-eksklyuziv-foto-video-131883/

В регулярных выражениях PCRE любой непробельный символ обозначается следующей конструкцией \S

Обратите внимание на слэш \ перед заглавной буквой S. Обратный слэш в регулярных выражениях отменяет обычное действие символа, мы могли бы написать просто символ буквы S и тогда она была бы просто заглавной буквой S в нашем регулярном выражении. Однако \S — означает ровным образом один любой символ, кроме пробела!

Теперь попробуем указать количество символов в строке. количество символов задается такими регулярными выражениями:

  • \S <5>— пять любых смиволов
  • \S <9>— девять любых символов
  • \S <3,7>— от трех до 7 символов включительно.

И если с разделами еще можно угадать, просто посчитав число символов — новости (7 символов), стайл (5 символов), то вот с остальной частью ссылки — угадать сложно. Решение простое — нужно указать что число символов — больше 1. Выгдялеть регулярное выражение будет таким образом — \S

Можно и уточнить — в разделах у нас указаны только буквы, а одна буква в системе PCRE имеет обознаяение \w

Попробуем вставить в шаблон ссылок сдедующее выражение

В тесте получаем ссылки рабочие, но ненужные — на служебные страницы, например:

Меняем вторую часть шаблона. Буквы в регулярных выражениях обозначаются \w, а цифры — \d. Во второй части шаблона имеются и буквы и цифры, поэтому регулярное выражение мы можем задать как \w\d

Когда нам нужно в регулярном выражении перечислить вхождение разных символов (набора символов), то мы можем использовать квадратные скобки. Выражение получается вида:

Это означает: любая одна буква или одна цифра или более подобных символов.

Нам также нужно отсечь в первой части ненужные разделы, изменим там условие — минимальное число букв-5. Теперь давайте протестируем суммарно получившийся шаблон

Результат видим такой:

Значит шаблон ссылок правильный и теперь можно продолжать настройку. Еще раз напомню, что работа с регулярными выражаениями для простого вебмастера и блогера — наиболее сложный этап. Запомните основные переменные которые нам понадобятся:

\S \d \w плюс квадратные и фигурные скобки

Подбор шаблона заголовка

Для того чтобы WPGrabber нашел заголовок в тексте страницы определенной новости нам необходимо описать шаблон его поиска. Тут тоже используется формат регулярных выражений как и в описании шаблона ссылок.

Идем на страницу новости и смотрим еще раз ее исходный html-код. Копируем заголовок и с помощью ctrl+F ищем его на странице. Среди многообразия нам нужно найти наиболее подходящий вариант — без дополнительных слов и символов.

В нашем случае мы видим варианты:

  1. Настасья Самбурская официально вышла замуж | StarHit.ru
  2. property =» og:title » content =» Настасья Самбурская официально вышла замуж | StarHit.ru «>
  3. name =» twitter:title » content =» Настасья Самбурская официально вышла замуж «>

xmlns =» http://www.w3.org/1999/xhtml » class =» article-title » itemprop =» name «> Настасья Самбурская официально вышла замуж

Вот именно в этом примере я бы испольховал третий. Составляем шаблон, который будет состоять из трех частей: name =» twitter:title » content =» НАЗВАНИЕ «>

Тут нужно запомнить два правила:

  1. Круглые скобки обозначают выборку определенной части текста из строки name =» twitter:title » content =»(НАЗВАНИЕ)»>
  2. Конструкция вида: .*? вбирает (поглощает) в себя любое кол-во символов вплоть до встречи со следующим символом после нее.

Итого заменяем НАЗВАНИЕ в шаблоне на (.*?) и получаем следующую рабочую структуру, которую и протестируем:

WPGrabber теперь находит правильные заголовки:

Настройка начальной точки и конечной точки контента

Снова переходим на нашу страницу новости с исходным кодом и ишем начало текста и конец. Для этого снова можно воспользоваться поиском ctrl+F. Смотрим метатег, который есть перед началом текста и вставляем его в настройках плагина.

В нашем случае можно пробовать два варианта, я бы использовал то, который выделен красным цветом — метатег явно указывает на начало текстового контента:

Теперь смотрим метатег после текста статьи. В нашем случае подойдет тег

Тестируем и смотрим на результат: шаблон ссылки сработал, заголовок — корректный, есть текстовый и даже фото-контент.

Все первая и наиболее важная часть подготовки сделана.

Плюшки

Также вы можете получить готовые ленты тематики «игровые новости». Достаточно просто импортировать файл в плагине.

Важные настройки других параметров

Теперь когда основные нвстройки сделаны и вы по образцу сделали несколько лент, нужно приступить к настройкам контента, картинок и вида.

Начнем с последнего — закладка «Вид»

По умолчанию она отображается так:

В заголовке — название, которое мы берем из источника, затем полный текст. Для того чтобы у вас не было дубликатов с другими сайтами — с этим шаблоном нужно немного поработать. Справа указаны переменные, которые Вы можете смело использовать. Также никто не запрещает добавить свой контент.

Шаблон текста может выглядеть примерно так:

%INTRO_TEXT%
%NOW_DATE%
%INTRO_PIC%
%FULL_TEXT%
[шорткод — цвет фона]Специально для сайта НАЗВАНИЕ САЙТА новость %TITLE% взята с сайта %SOURCE_SITE% (Источник)[/конец шорткода]

Можно также добавить шорткод перелинковки или рекомендуемого контента между %INTRO_PIC% и %FULL_TEXT%.

Всё это сделает ваш текст отличающимся от других, а также установка ссылки на источник поможет избежать проблем с авторскими правами.

Теперь закладка «Картинки»

Настраиваем ее также как указано на картинке. Единственное, что можно поварьировать — это миниатюры и полноразмерные картинки установить в соответствии с темой оформления сайта.

Закладка «Контент»

За один запуск сохранять не более (записей) — тут решайте сами, я в основном ставлю 0 — неограничено.

Сохранять записи только уникальными (не повторяющимися) заголовками — ДА

Сохранять записи в Рубрике — тоже выбираете сами.

Тип — Запись

Автор записей — тут тоже решайте сам, я создаю специально пользователя с админскими доступами для автонаполняемых сайтов.

Статус создаваемых записей — опубликовано.

Для выделения анонса вставлять тег Далее — зависит от темы оформления.

Размер анонсовой части текст (кол-во символов) — на ваше усмотрение, обычно анонс — это 20-30 слов, то есть 500 — 600 знаков.

Конечный символ для отделения анонса — ставим точку.

Формировать постоянные ссылки для записей — Да

Метод генерации — транслитерация.

Размер алиаса — 0 (не обрезать)

Еще несколько рекомендаций для выживания сайта с плагином вп-граббер

  1. Добавляейте БОЛЬШОЕ количество лент. В автонаполняемом блоге должно быть 20-30 и более источников.
  2. Установите плагины:
    • Auto Featured Image from Title — создает миниатюры с текстом заголовка, пригодится когда граббер автоматом не может прочитать первую картинку в тексте.
    • SEO Friendly Images — автоматически прописывает в картинке метатег «alt».
    • Auto Tags Generator — автоматически генерирует метки вордпресс из названия.
    • Inline Related Posts — создает автоматическую перелинковку в теле поста.
    • New Adman — с его помощью можно добавить любой код или текст или картинку в тело поста.
  3. Создайте для автонаполняемого проекта страницы или группы в социальных сетях и делайте туда автоматические перепосты. Даже если группа имеет всего 10 подписчиков — это уже плюс. И положительный сигнал для поисковых систем.
  4. Закажите прогон по профилям, трастам или форумам. В крайнем случае купите несколько недорогих безанкорных ссылок.
  5. Заведите за правило, раз в месяц, заглядывать на сайт и проверять работоспособность лент и плагинов.

Другие работающие плагины для автонаполнения сайта на вордпресс

Я приведу ниже список плагинов, которые позволяют настроить автонаполнение сайта:

  • Syndicate Press
  • Push Syndication
  • FeedWordPress
  • Syndicate Out
  • CyberSyn
  • Wp-0-matic
  • WP RSS Aggregator
  • RSS AutoPilot
  • AUTOBLOG от WPMUDev
  • WordPress Automatic Plugin
  • WP Robot
  • WPeMatico

У каждого из этих плагины есть свои плюсы и минусы Одни — давно не обновлялись, другие стоят своих денег. Подробнее писать не буду из всех этих плагинов тестировал только Wp-О-matic.

Монетизация автонаполнемого сайта

Лучший способ монетизации таких проектов — это контекстная реклама. Установил и забыл, а копеечки капают.

Второй способ это продажа ссылок в автоматических биржах. Тут желательно поработать с ссылочным и получить хотя-бы тиц 10.

Пример: один средненький сайт с небольшой посещаемостью. Расходы в год — на домен 100 руб. (рекомендую 2domains.ru), на хостинг — 0 руб (Хотите узнать как — задайте вопрос в комментариях). Доход за год небольшой — около 12 долларов , но трафик минимально растет, сайт в индексе, перспективы хорошие. Значит и в дальнейшем он будет приносить небольшой, но пассивный доход.

Стоит ли создавать автонаполняемый сайт, вероятно — да. Это своеобразный задел на пенсию — понемногу, но стабильно. Если вы знаете другие способы монетизации — пишите в комментариях.

Источник

Оцените статью