Исследование методов автоматизированного извлечения данных из веб-ресурсов с динамически изменяемым контентом с помощью ИИ-агентов
Рассматривается задача автоматизированного извлечения данных из веб-ресурсов с динамически изменяемым контентом с применением ИИ-агентов. Показано, что практика сбора данных остается фрагментированной: неоднородность DOM-структур, активные действия пользователя, средства антибот-защиты и высокая доля неструктурированных веб-данных повышают стоимость сопровождения классических парсеров. Предложен двухэтапный метод, разделяющий дорогостоящий этап анализа ресурса языковой моделью и экономичный этап массового детерминированного сбора. Метод реализован в программном макете на базе мультиагентной оркестрации OpenClaw, изолированного браузерного контура Chromium, протокола Model Context Protocol и контура авторизации. Выполнены сравнительный анализ средств сбора и больших языковых моделей, классификация типов лент и активных действий, а также экспериментальная оценка качества извлечения. На эталонном наборе данных основной показатель качества составил F1 = 0,89. Ограничения связаны с зависимостью от устойчивости селекторов, изменчивостью антибот-механизмов и вычислительной стоимостью этапа конфигурирования.


