- Сотбит: Парсер контента
- Настройка модуля
- Загрузка товаров, парсер сайтов, импорт
- Технические данные
- Описание
- Парсер контента
- Добавление парсеров
- Описание
- Content Parser
- Объявление функции-обработчика
- Добавление парсера
- Пример
- PHP Parser
- Объявление функции-обработчика
- Добавление парсера
- Пример
- DOM Handler
- Объявление функции-обработчика
- Добавление обработчика
- Пример
- Пользовательские комментарии
Сотбит: Парсер контента
Настройка модуля
Для каждого типа контента используется соответствующий тип парсера. Выбирается он на вкладке «Парсер». Изменить тип парсера после сохранения нельзя.
- RSS подходит для обработки новостных лент соответствующего формата.
- Page и Catalog используются для обычных HTML-страниц любых сайтов и каталогов товаров.
- XML и XML+ Catalog позволяют переносить данные с сайтов с сохранением сложной структуры категорий, сам файл с данными должен соответствовать формату. Подходит и для Яндекса (формат YML).
- XLS и XLS + Catalog работают файлами таблиц, выгружаемыми для табличных редакторов Excel, Calc, Numbers и их аналогов.
- CSV работает с данными в формате «текст с разделителями».
Для настройки парсера не нужно обладать знаниями PHP или навыками программирования, достаточно просто заполнить настройки в административной части сайта.
Располагаются они в разделе Контент -> Парсер:
Часто возникает необходимость решать сложные задачи, которые требуют настройки нескольких парсеров. Например, нужно выгрузить список товаров с сайта, затем уточнить какие-то свойства товаров из YML файла магазина, а после проставить наличие товаров на складах из таблички Excel, полученной от поставщика.
В такой ситуации проще всего создать три отдельных парсера: первый (catalog) получает все доступные данные с сайта, второй (XML) обновляет выбранные свойства из файла по артикулу, третий (XLS) обновляет только количества из таблицы по артикулу. Работать они могут автоматически и независимо друг от друга.
Источник
Загрузка товаров, парсер сайтов, импорт
Технические данные
Описание
Модуль позволяет парсить сайты прямо из админки битрикса, напрямую добавляя товары в инфоблок. Парсер может загружать товары, новости, табличные данные, парсить любую информацию, размещенную на сторонних сайтах. Парсинг одна из возможностей модуля. При необходимости, мы можем подключить интеграцию по API вашего поставщика.
Парсер :
— Загрузка товаров из всех категорий
— Удобное управление категориями сайта источника
— Автоподсказки селекторов при настройке помогают избежать ошибок
— Гибкие настройки любой сложности и кастомизация
— Сохранение товаров со всеми параметрами и изображениями
Указав в настройках выбор категорий на сайте источнике, вы можете легко управлять категориями, из которых хотите парсить товары. Так же на свое усмотрение, можете переименовывать категории согласно структуре вашего сайта.
Автоматические подсказки уберегут вас от ошибок и опечаток, сэкономив вам время настройки парсера.
Возможности:
— Встроенный парсер любых сайтов
— Импорт csv
Дополнительно наши специалисты помогут подключить :
— Базы поставщиков
— Интеграцию складов
— Импорт любой сложности
| 1.3.4 (28.09.2021) | Изменение способа подключения файлов ресурсов для обработчиков |
| 1.3.3 (27.09.2021) | Исправление установки |
| 1.3.2 (23.09.2021) | Обновление автоматического перехода по страницам пагинации |
| 1.3.1 (20.05.2021) | Улучшение интерфейса |
| 1.3.0 (21.04.2021) | Основной модуль: Возможно переименовывания разделов Система постоянных данных в процессе работы Исправления Парсер: Автоматические подсказки Установка Cookie и Header при соединении |
| 1.2.3 (16.04.2020) | Добавлена возможность сохранять профили в файл. |
| 1.2.2 (27.02.2020) | Дополнительные обновления |
| 1.2.01 (19.06.2019) | Основной модуль: Объединение нескольких значений одного свойства при сохранении Новый обработчик, заполнение свойств по данным фильтра (бета версия) Система проверки совместимости сайта с модулем |
Парсер:
Выбор следующей страницы по номеру
Добавление детального изображения из свойства дополнительных изображений
Добавлено установка кодировки для страниц.
Добавлена возможность указать значение для свойств.
— возможность запрета добавления новых элементов.
Парсер — добавлена возможность со страниц товаров выбирать внутренние разделы, так же пагинация по содержанию элемента.
Добавлена настройка задержки при выполнени
Добавлены системные настройки
определение корневого раздела для загрузки.
Парсер:
Оптимизирована загрузка файлов в свойства.
После покупки решения необходимо:
- Авторизоваться в панели управления Вашего сайта под правами администратора.
- Зайти в раздел Marketplace > Обновление решений — вкладка «Активация купона» и ввести купон в специальном поле.
- После ввода купона в списке решений для установки появится купленное решение. Нажмите кнопку «Установить».
После успешной установки вас перенаправит на завершающую страницу:
Вы можете произвести проверку системы на совместимость и наличие необходимых компонентов, или начать работать, добавив профиль.
| Для работы модуля необходимы компоненты php: curl и dom. |
Техподдержка решения осуществляется только по почте:
При обращении впервые указывайте, пожалуйста, номер вашего купона и адрес сайта.
Источник
Парсер контента
Очень часто у заказчиков возникает желание брать контентную информацию с ряда сайтов. И конечно же заказчик не собирается это делать ручками, а хочет чтобы все было разово настроено и автоматически работало. Для этого и предназначен модуль shs.parser . Он позволяет по rss каналам брать ссылки на материалы сайтов и парсить контент этих сайтов.
Контент загружается с помощью библиотеки cURL(на стороне сервера) и парсится с помощью библиотеки PHP Simple HTML DOM Parser(включена в модуль). Подробнее про эту библиотеку вы можете почитать на просторах интернета, в данной статье я затрагивать этот вопрос не буду, а лишь опишу функциональные возможности модуля и кратко принцип работы.
Принцип работы модуля прост:
1. Подключается к rss потоку, разбирает xml выдачу.
2. По урлам xml выдачи осуществляет парсинг материалов сайта.
3. Создает новые элементы с распарсенным материалом.
И так. Заходим в модуль Парсер контента в блоке Контент. И мы сразу видим нечто похожее на функционал инфоблоков. На данном этапе мы можем добавить новый парсер. Парсер, терминологией инфоблоков, это некий элемент, обладающий определёнными свойствами и позволяющий парсить контент сайтов.
На данной картинке представлена вкладка Парсера по-умолчанию. Основными параметрами этой вкладки являются.
Название – название файла, обязательное поле, но на работу никак не влияющее.
RSS канал – одно из основных полей, в которое вводится полный адрес rss потока. Именно по этому адресу будет разбираться rss xml. При допущении ошибки в данном поле парсер работать не будет.
ID инфоблока – идентификатор инфоблока, в который будет осуществляться запись вновь созданных элементов.
ID раздела – идентификатор раздела.
Селектор контента – еще один из основных параметров парсера. Это путь контента на сайте, который мы собираемся парсить. Фактически парсер забирает именно содержимое этого селектора.
Кодировка – кодировка сайта, который парсим. В будущем будет добавлено автоопределение.
На данной картинке представлена вторая вкладка парсера — Превью. Тут отображены все параметры, которые связаны с парсингом превью информации. То есть фактически это информация, которая берется непосредственно с rss потока из тега description.
Некоторые параметры кладки:
Удалять теги – удаляет все теги в превью описании.
Кроме следующих – указывается список тегов, которые не требуется удалять. Пример:
— значит, то эти два тега не будут удалены из превью описания.
Первая картинка, как превью – картинка для превью берется как первая из описания.
Заменять пути/сохранять картинки на сервер – интересный параметр, позволяющий подменять пути к картинкам на свои(относительно своего сайта), при этом сохраняя картинки на свой сервер.
Удалять элементы – позволяет удалять обозначенные элементы. Перечисление идет через запятую.
Удалять атрибуты элементов – удаляет атрибуты у заданных элементов, перечисление идет через запятую.
Вкладка детально выглядит идентично вкладке Превью с аналогичными полями и функционалом с той лишь разницей, что контент для Детальной информации берется непосредственно с контента сайта.
И последняя вкладка — Общие настройки Парсера.
Описание некоторых параметров:
Парсить мета-описание – забирает мета-описание со страницы сайта, котоырй парсим.
Парсить ключевые слова – забирает ключевые слова со страницы сайта.
Запускать по агенту – запуск парсера будет осуществляться по агенту.
Периодичность запуска – периодичность запуска агента.
Источник
Добавление парсеров
Описание
API визуального редактора предусматривает возможность добавления парсеров в визуальный редактор. Данная возможность позволяет включить свои обработчики в процесс разбора кода редактируемого документа на этапе формирования его визуального представления (в момент загрузки документа и при переключении из режима редактирования кода в визуальный режим).
Средствами API визуального редактора можно подключить парсеры(обработчики) трех видов.
В совокупности они позволяют наиболее эффективно реализовывать пользовательскую обработку документа на этапе формирования визуального отображения документа. Виды:
- Парсер исходного кода документа (Content Parser)
- Парсер фрагментов PHP-кода (PHP Parser)
- Обработчик визуального отображения средствами DOM (DOM Handler)
Content Parser
Позволяет обработать документ на уровне его исходного кода.
Подключения парсера проходит в два этапа:
- Объявление функции-обработчика
- Добавление парсера, путём вызова метода addContentParser() глобального объекта oBXEditorUtils
Объявление функции-обработчика
Добавление парсера
Пример
PHP Parser
Объявление функции-обработчика
Добавление парсера
Пример
Примечание: при добавлении парсеров исходного кода документа (Content Parser) и фрагментов PHP-кода (PHP Parser) следует обратить внимание, что вносимые изменения должны быть корректным HTML-кодом, т.к. в случае ошибки визуальный редактор может работать некорректно.
DOM Handler
Объявление функции-обработчика
Добавление обработчика
Пример
Пользовательские комментарии
Мы будем рады, если разработчики добавят свои комментарии по практическому использованию методов системы.
Для этого нужно всего лишь авторизоваться на сайте
Но помните, что Пользовательские комментарии, несмотря на модерацию, не являются официальной документацией. Ответственность за их использование несет сам пользователь.
Также Пользовательские комментарии не являются местом для обсуждения функционала. По подобным вопросам обращайтесь на форумы.
Источник