Что такое большие данные и как они помогают журналистам

Санкт-Петербургский университетHi-Tech

Читать между цифр

Создавать материалы с повышенной степенью достоверности и менять с их помощью мир — такие возможности есть у журналистов, если они умеют работать с большими данными

Автор: Евгения Орлова

Magnific

И это далеко не все преимущества владения подобным навыком, считают ученые Санкт-Петербургского университета, в частности Ренат Масгудович Касымов, ассистент кафедры цифровых медиакоммуникаций СПбГУ. Вот уже несколько лет он учит будущих сотрудников СМИ грамотно анализировать массивы информации и использовать эту компетенцию в рамках профессиональной деятельности.

«Например, с бакалаврами программ „Журналистика“ и „Международная журналистика“ на курсе „Аналитика в медиа: специализированные сервисы“ мы разбираем инструменты для сбора различных данных с сайтов и из социальных сетей об аудитории и контенте. Рассматриваем основные статистические методы, позволяющие более детально работать с цифрами, находить закономерности, выявлять тенденции. Логическим продолжением выступает курс „Визуальное представление данных“. В ходе него студенты учатся представлять аналитические выводы в понятной и доступной для восприятия графической форме — в виде инфографики, диаграмм, интерактивных отчетов (дашбордов)», — рассказывает исследователь.

Похожую работу он ведет и с магистрантами образовательной программы СПбГУ «Искусственный интеллект в журналистике и медиакоммуникациях»: на протяжении двух семестров учит студентов основам программирования и создания собственных инструментов для получения, обработки и визуализации больших данных (Big Data), в том числе с применением ИИ-технологий.

Ренат Масгудович Касымов, ассистент кафедры цифровых медиакоммуникаций СПбГУ. Предоставлено Р. М. Касымовым

Увидеть важное

Как отмечает Ренат Касымов, такими навыками хотя бы на начальном уровне в наши дни полезно обладать всем журналистам. Прежде всего для того, чтобы в постоянно растущем информационном потоке вовремя замечать важные и социально значимые темы для потенциальных материалов. Сейчас сотрудникам СМИ доступно огромное количество данных: государственная статистика, отчеты ведомств и частных компаний, результаты глобальных опросов, исследований и мониторингов. Анализируя и сопоставляя все эти сведения, медиаспециалисты могут выявлять различные общественные проблемы, а своими публикациями даже частично способствовать их решению.

Подобное, к примеру, недавно удалось сотрудникам Reuters. Журналисты издания изучили последствия пожара, произошедшего в 2017 году в лондонском здании Grenfell Tower. Тогда огонь за 15 минут охватил 24-этажный дом и унес жизни более чем 70 человек. Причиной столь стремительного распространения пожара стал легковоспламеняющийся материал облицовки.

Репортеры Reuters проанализировали данные о его поставках в разные страны, отчеты официальных расследований похожих крупных возгораний, техническую документацию пострадавших зданий. В результате журналисты выяснили, что в некоторых европейских городах до сих пор есть жилые дома с той же самой опасной облицовкой. Опубликованный изданием материал «Покрытые твердым бензином» (Buildings Wrapped in Solid Gasoline, 2025) вызвал широкую общественную дискуссию и помог пересмотреть требования к пожарной безопасности в отдельных государствах.

Проверить на точность

С помощью больших данных и технологий для их автоматического анализа журналисты сегодня также могут повышать эффективность своей работы. В том числе улучшать качество материалов за счет более надежной проверки фактов. Современные алгоритмы позволяют работникам СМИ оперативно находить первоисточники информации, сравнивать слова экспертов с их предыдущими заявлениями и официальными отчетами или, к примеру, сканировать метаданные документов: сведения об авторе, дате и месте создания, внесенных изменениях. Последние часто используют для определения подлинности материалов — текстов, изображений и видео. Так журналисты, в частности, узнают, не выдаются ли старые фотографии за свежие и правили ли их в графическом редакторе.

Большие данные сотрудники редакций применяют и для того, чтобы увеличить количество выпускаемых текстов. Они используют искусственный интеллект для отслеживания статистики и автоматического создания новостей на ее основе. «Подобным образом, например, уже готовятся сводки об экономике, спорте, погоде и региональных событиях. С внедрением больших языковых моделей практика стала расширяться и на более нишевые тематики, регулярное освещение которых раньше было просто финансово невыгодным», — объясняет Ренат Касымов.

На основе больших данных уже автоматически создаются сводки об экономике, спорте, погоде. Magnific

Познакомиться поближе

Особую пользу журналистам приносит информация о поведении читателей. Она позволяет определять, какие материалы вызовут у аудитории больший отклик, и на основании этого адаптировать редакционный контент, тем самым повышая вовлеченность пользователей.

«На базовом уровне сотрудники СМИ используют для подобных целей сравнительные тестирования. Например, одновременно публикуют один и тот же материал с двумя разными заголовками. Часть аудитории при заходе на сайт видит один вариант, остальные — другой. Специальные цифровые инструменты позволяют автоматически фиксировать, на какой из них пользователи кликают чаще. Так редакции достаточно быстро выявляют заголовок, сильнее удерживающий внимание читателей, и выводят именно его на все страницы», — рассказывает Ренат Касымов.

Исследователь добавляет, что для более глубокого и масштабного изучения пользовательского поведения издания применяют нейросетевые модели. Благодаря им становится возможным одновременно получать, анализировать и сравнивать множество параметров. Например, поисковые запросы аудитории, длительность и глубину просмотра материалов, частоту заходов в группу или на сайт СМИ, время задержки на конкретных текстах и картинках. Также используется информация о том, каким публикациям пользователь ставит отметку «мне нравится», что он репостит, сохраняет в закладки и комментирует. Некоторые онлайн-платформы дополнительно определяют геолокацию читателя, тип устройства, с которого он выходит в интернет, и то, как меняются его действия с момента первого посещения страницы издания до превращения в постоянного посетителя.

На основе этих данных нейросетевая модель строит различные прогнозы. В частности, предсказывает, какие темы заинтересуют пользователя в будущем, какие публикации с высокой долей вероятности убедят его оформить подписку и когда он может потерять интерес к изданию. Подобные выводы помогают редакциям выстраивать более эффективные стратегии по привлечению и удержанию аудитории. «Кроме того, с помощью анализа больших массивов информации издания могут определять частоту упоминаний собственного бренда на внешних площадках и его позицию среди конкурентов, а также выявлять отраслевые тренды для их внедрения в редакционную практику», — добавляет Ренат Касымов.

Анализ данных об аудитории помогает журналистам прогнозировать, какие темы в перспективе вызовут у читателей больший отклик. Magnific

Совершенствовать умения

По прогнозу эксперта, в будущем значимость навыков работы с большими данными в журналистской сфере лишь возрастет, поскольку и сам рынок Big Data продолжит активно развиваться.

«Думаю, на все, что связано с большими данными, в том числе в медиа, особое влияние будут оказывать нейросети. Достаточно скоро мы сможем пользоваться алгоритмами, которые позволят анализировать интересы и поведение пользователей почти мгновенно, научимся более точно выявлять дезинформацию. В условиях тиражирования однообразного сгенерированного контента, скорее всего, вырастет спрос на дата-сторителлинг, то есть на истории, основанные на данных. Причем особое развитие получат интерактивные форматы», — приводит пример Ренат Касымов.

Он добавляет, что в России отдельное внимание будут уделять разработке собственных инструментов анализа и обработки больших массивов информации. Это позволит обеспечить инфраструктурную независимость и безопасность страны.

«Параллельно с технологическим развитием будут формироваться и правовые нормы. Уже сейчас идет активное обсуждение обязательной маркировки ИИ-контента, требований к прозрачности рекомендательных алгоритмов и ответственности за создание дипфейков (гиперреалистичных аудио-, видео- и фотоматериалов с участием людей. — Прим. ред.), — подчеркивает Ренат Касымов. — Но все же главные изменения ближайших лет, как мне кажется, ждут нас не в технологической области. Чем больше рутины на себя возьмут машины, тем выше будет цениться то, что они делать не способны: умение понимать смыслы, расставлять моральные приоритеты, поднимать вопросы, которые еще никто не задавал. Поэтому еще сильнее увеличится спрос на подобные компетенции журналистов».

Словарь

Большие данные (Big Data) — информация с несколькими признаками:

  • большой объем (невозможно обработать традиционными средствами),
  • высокая скорость накопления и обновления,
  • разнообразие форматов (фото, видео, тексты),
  • достоверность (надежность и качество данных могут различаться, поэтому источники и методы их получения требуют проверки),
  • изменчивость (меняется в онлайн-режиме),
  • ценность (позволяет делать социально значимые выводы и на их основе принимать решения).

В медиасфере большими данными часто называют любые крупные массивы информации, даже если они не обладают вышеуказанными признаками.

Факт

Magnific

Наиболее часто российские журналисты готовят на основе больших данных публикации на социально-экономические темы, реже всего — про культуру, науку и технологии.

Источник: Д. Кэхэ, Е Цзы. Журналистика данных и производство новостей: изменения в технологиях, инструментах и повествованиях. 2024 год

Где еще применяют большие данные?

  • Государственное управление. Большие данные помогают руководящим органам разрабатывать для граждан актуальные программы (например, в области здравоохранения или занятости).
  • Промышленность. Благодаря автоматическому сбору и анализу больших данных предприятия прогнозируют сроки работы оборудования, спрос на продукцию, расходы.
  • Медицина. Большие данные применяются при разработке новых способов диагностики заболеваний, создании инновационных лекарств, планировании мер по борьбе с пандемиями.
  • Розничная продажа. Магазины анализируют данные о покупателях и их интересах и на основе этого готовят персонализированные предложения.
  • Спорт. Большие данные помогают спортивным клубам находить по всему миру самых перспективных игроков.
  • Сельское хозяйство. Благодаря большим данным агропредприятия прогнозируют урожайность, риски заморозков, засухи и появление вредителей.

Источник: trends.rbc.ru

Хочешь стать одним из более 100 000 пользователей, кто регулярно использует kiozk для получения новых знаний?
Не упусти главного с нашим telegram-каналом: https://kiozk.ru/s/voyrl

Авторизуйтесь, чтобы продолжить чтение. Это быстро и бесплатно.

Регистрируясь, я принимаю условия использования

Открыть в приложении