Введение
Анализ тональности текстов, или сентимент-анализ, представляет собой одно из наиболее востребованных направлений компьютерной лингвистики и обработки естественного языка. Его основная задача заключается в автоматическом определении эмоциональной окраски высказывания — позитивной, негативной или нейтральной. В условиях стремительного роста объёмов пользовательского контента в социальных сетях потребность в эффективных инструментах извлечения оценочной информации становится критически важной для бизнеса, государственных структур и исследовательских организаций. По данным DataReportal, в январе 2025 года в России насчитывалось 133 млн пользователей интернета, что составляло 92,2% населения, а число активных идентификаторов пользователей социальных сетей достигало 106 млн — 73,4% населения.
Социальные сети являются уникальной средой коммуникации, где тексты отличаются краткостью, неформальностью, обилием сленга, эмодзи, опечаток и иронических конструкций. Эти особенности существенно затрудняют применение традиционных методов анализа, разработанных для стандартных текстов. Русскоязычный сегмент социальных медиа добавляет дополнительные сложности, связанные с морфологическим богатством языка, свободным порядком слов и высокой вариативностью выражения эмоций. По данным Левада-Центра, в марте 2025 года 76% опрошенных жителей России посещали социальные сети, в том числе 58% — ежедневно, причём половина пользовалась «ВКонтакте», а 42% — Telegram.
В связи с этим разработка специализированного программного комплекса, учитывающего специфику русскоязычных текстов социальных сетей, является актуальной научно-практической задачей. Такой комплекс должен обеспечивать сбор, предобработку, классификацию тональности и визуализацию результатов, а также допускать расширение и замену отдельных компонентов.
Актуальность темы
Актуальность темы обусловлена необходимостью повышения точности и адаптивности инструментов анализа тональности применительно к неформальным коротким текстам социальных сетей. Существующие универсальные решения часто демонстрируют низкое качество на русскоязычных данных из-за недостаточного учёта лингвистических особенностей и отсутствия репрезентативных размеченных корпусов. По данным DataReportal, в 2025 году в мире насчитывалось 5,24 млрд активных идентификаторов пользователей социальных сетей, а за предшествующие 12 месяцев их число выросло на 4,1%, что подтверждает рост объёмов пользовательского контента. Разработка программного комплекса, ориентированного на специфику социальных медиа, позволит сократить трудозатраты аналитиков и повысить достоверность мониторинга общественного мнения.
Степень разработанности темы
Теоретическую базу исследования составляют труды в области компьютерной лингвистики, машинного обучения и анализа тональности. Среди зарубежных учёных ключевое значение имеют работы Б. Панга, Л. Ли, К. Мэннинга, П. Турни. Отечественная научная школа представлена исследованиями И. В. Сеина, Н. В. Лукашевич, Е. И. Большаковой, А. А. Котова.
Объект и предмет исследования
Объект исследования — Объектом исследования являются русскоязычные тексты социальных сетей как источник данных для автоматического определения тональности.
Предмет исследования — Предметом исследования выступают методы, модели и программные средства анализа тональности коротких неформальных текстов.
Цель и задачи работы
Цель работы — Цель работы — разработать программный комплекс для автоматического анализа тональности русскоязычных текстов социальных сетей с оценкой качества классификации на реальных данных.
Для достижения цели поставлены задачи:
- Изучить понятие тональности и уровни анализа текста.
- Проанализировать методы и модели классификации тональности.
- Выявить особенности русскоязычных текстов социальных сетей.
- Провести обзор программных комплексов и сервисов анализа тональности.
- Сформировать корпус текстов социальных сетей и выполнить его разметку.
- Провести сравнительный эксперимент моделей классификации тональности.
- Разработать архитектуру и определить компоненты программного комплекса.
- Реализовать модули сбора, обработки и классификации текстов.
- Оценить эффективность комплекса и предложить механизм внедрения.
Методы исследования
В работе используются методы компьютерной лингвистики, машинного обучения, статистического анализа, а также экспериментальное сравнение алгоритмов классификации на размеченном корпусе текстов.
Теоретическая и практическая значимость
Теоретическая значимость исследования заключается в систематизации подходов к анализу тональности неформальных русскоязычных текстов, выявлении лингвистических особенностей социальных сетей и обосновании выбора нейросетевых моделей для коротких сообщений.
Практическая значимость состоит в создании программного комплекса, позволяющего автоматизировать сбор, обработку и классификацию текстов социальных сетей, что может быть использовано в задачах мониторинга общественного мнения, маркетингового анализа и управления репутацией.
Структура работы
Диссертация состоит из введения, трёх глав, заключения, списка литературы и приложений. Во введении обоснована актуальность темы, сформулированы цель, задачи, объект и предмет исследования, научная новизна и положения, выносимые на защиту. Первая глава посвящена теоретико-методологическим основам анализа тональности. Вторая глава содержит анализ данных и существующих решений. Третья глава описывает разработку программного комплекса и оценку его эффективности. В заключении подведены итоги работы.