Исходный размер 1146x1600

Отношение людей к искусственному интеллекту

PROTECT STATUS: not protected

Так как я работаю в одной из главных ИИ компании страны страны, мне стало интересно, а как люди относятся к искусственному интеллекту

Люди боятся его? Любят? Или на самом деле они спокойны к разивитию ИИ?

В качестве основы для анализа я взял открытый датасет AI Reddit Dataset на почти 1,5 гб с комментариями и постами с Reddit, в которых упоминается ИИ.

Посты: 366,392 записи Комментарии: 1,033,600 записей Период: январь 2021 - май 2023

Исходные данные представляли собой csv с ячейками: автор, дата, содержимое комментария или поста.

То есть работать можно было с body (сам текст) и date (дата мнения).

Этот датасет также интересен, потому что в его период выходили самые первые крупные релизы и анонсы в сфере ИИ: Stable Diffusion (август 2022), ChatGPT (ноябрь 2022), DALL-E 2 (апрель 2022). Некоторые из них я дальше тоже проанализирую.

Типы графиков

Я использовал следующие типы:

Обычные линейные графики и линейные с пересечением области. Для показа динамики отношения к ИИ по месяцам. Круговые графики в горизонтальном и вертикальных форматах , для наглядного распределения мнений. Столбчатые, для сравнения отношения в постах и комментариях. Сгруппированные столбчатые графики для сравнений сразу двух типа мнений в динамике.

План проекта

  1. Загрузка датасета с Kaggle
  2. Подготовка данных (uid для мэтча анализа от Gigachat и Sentiment модели с HF, даты, месяцы)
  3. HuggingFace Sentiment анализ (20к единиц данных)
  4. GigaChat API анализ (2к единиц данных)
  5. Визуализация (через библиотеку matplotlib)

Почему именно такой план?

После консультации с преподавателем я понял, что для хорошего анализа мне нужно прогнать данные через LLM.

Я начал тестировать промпт в Gigachat Playground. Первые результаты мне не понравились. Я сделал промпт более жестким. Но Гига все равно путалась с Sentiment-определением Негатив/Позитив/Нейтрально (далее HF). Она либо определяло все неправильно, путать между собой определения, либо начинала выдумывать свои параметры.

Преподаватель отправил кейс Яндекса с анализом отзывов вокзалов Москвы, и для анализа HF они использовали обученную под эту задачу модель с HuggingFace. Я понял, что они наткнулись на похожую проблему и взял для HF готовую модель.

По итогу: Модель с HF - анализирует по простому принципу негатив, позитив или нейтрально. Gigachat API: определяет 1) как видит ИИ пользователь 2) какие эмоции он испытывает к ИИ

1. Загрузка данных

Исходный размер 1498x632

2. Подготовка данных

Подготвока данных для мэтча между двумя LLM анализами, а также для создания равномерного сэмла по дате. Так как весь объем данных я бы не смог обработать из-за ограничения в виде GPU и токенов.

uid - уникальный идентификатор для мэтча результатов month - для равномерного семплирования по времени

Исходный размер 1530x968

3. HuggingFace Sentiment анализ

Исходный размер 1244x894

4. Анализ по GigaChat API

Исходный размер 2048x2122

Батчинг для GigaChat

Исходный размер 1480x1006

Стилизация графиков

Исходный размер 1936x2346
Исходный размер 1710x775

Токены на создание промпта

Исходный размер 1710x791

Токены на анализ данных

Статистические методы

Стратифицированная выборка: равномерное распределение по месяцам Value counts: подсчёт частот категорий Normalize: приведение к процентам Groupby + aggregation: группировка по месяцам Кросс-табуляция: связь между HF и GigaChat результатами

Форматы

Анализ конкретных чисел и фактов: Распределения sentiment и attitude Поиск паттернов в данных Сравнение submissions и comments

Субъективный анализ: Динамика негатива до/после релизов ИИ-продуктов Связь между страхом и восприятием ИИ как угрозы Ответы на конкретные вопросы об отношении к ИИ

Негатив в комментариях стабильно выше, чем в постах.

Исходный размер 2618x1297

Большинство текстов имеют нейтральное отношение. Страх и критика составляют небольшую долю.

Отношение людей к искусственному интеллекту
Проект создан 17.01.2026
Мы используем файлы cookies для улучшения работы сайта НИУ ВШЭ и большего удобства его использования. Более подробную...
Показать больше