Частотный анализ числовых и текстовых данных. Учебное пособие. Валентин Юльевич Арьков

Читать онлайн.
Название Частотный анализ числовых и текстовых данных. Учебное пособие
Автор произведения Валентин Юльевич Арьков
Жанр
Серия
Издательство
Год выпуска 0
isbn 9785005988416



Скачать книгу

значений – один из способов первоначальной обработки данных. Чаще всего его относят к описательной статистике (Descriptive Statistics). В последнее время также говорят об описательной аналитике (Descriptive Analytics). Подсчет частот имеет отношение распределению. Поэтому его восприятия материала желательно обладать пониманием основ теории вероятностей и математической статистики.

      В данной работе мы рассмотрим примеры и приемы частотного анализа числовых и текстовых данных средствами Python.

      К этому материалу следует относиться именно как к примерам. Потому что есть много способов выполнить одно и то же действие. Разные способы и разные алгоритмы могут дать в конечном счете один и тот же результат.

      Данное пособие можно скачать совершенно бесплатно через сайт издательства Ридеро. Причем в разных форматах.

      Введение

      Частотный анализ – это изучение характеристик распределения случайной величины. Напомним, что распределение описывает вероятность (частоту) появления тех или иных значений статистического признака. Анализ формы и параметров распределения обычно относят к описательной статистике – Descriptive Statistics.

      Язык Python во многом построен как объектно-ориентированный, поэтому мы имеем дело с объектами. А у объектов есть методы, которые соответствуют понятию функция и команда в традиционном программировании. Для упрощения мы будем говорить «функция», не углубляясь в технические подробности.

      Мы будем выполнять работу в облачной среде Google Colab, но программу можно также использовать (с небольшими доработками) и в других средах. Основное преимущество Colab – это возможность приступить к работе, не занимаясь установкой программного обеспечения. Требования к компьютеру минимальные: наличие браузера и подключения к интернету.

      1. Начало работы

      1.1. Результаты и защита

      Здесь мы обсудим первые шаги и основные моменты, касающиеся выполнения работы. В данной работе мы проводим обучение в режиме мастер-класса, когда студенты повторяют действия специалиста – «мастера своего дела». В данном выражении слово «класс» означает «занятия на выбранную тему». Это выражение позаимствовано из английского. Фактически, это английское выражение master class, записанное русскими буквами, а вовсе не перевод.

      Программа на Python уже готова, её можно просмотреть, скачать и запустить. Мы обсуждаем её по частям, которые называются ячейками. Студентам нужно с этой программой ознакомиться и «поиграться», меняя некоторые параметры. В конечном счёте нужно достичь некоторого понимания и способности использовать и модифицировать эту готовую программу.

      Поэтому в тексте даются пояснения и несложные задания. Во время защиты студент демонстрирует понимание материала и способность осмысленно использовать готовые команды и конструкции языка.

      За счет такого подхода можно быстро войти в курс дела и сделать первые шаги в аналитике данных на Питоне.

      Задание. Просмотрите в Википедии статью Мастер-класс.

      1.2. Работа и отчет

      Будем выполнять работу в облачном блокноте Jupyter Notebook в среде Google Colab.

      https://colab.research.google.com/

      Для работы понадобится подключение к интернет и учетная запись Google. Наш блокнот одновременно является инструментом для анализа данных и отчетом, в котором мы «документируем» все наши действия – шаг за шагом.

      Для работы на локальном компьютере можно использовать бесплатную среду Anaconda с аналогичными возможностями.

      https://www.anaconda.com/

      Еще один вариант – это запуск на локальном компьютере контейнера с Anaconda и работа с ним через браузер.

      1.3. Создание блокнота

      При открытии страницы Colab выбираем создание нового блокнота: New Notebook. Задаём ему информативное название.

      Блокнот состоит из ячеек, которые могут содержать программный код – Code — или текст – Text. Для создания очередной ячейки нажимаем соответствующую кнопку, см. рис.

      Рис. Создание ячейки

      Отчёт по лабораторной работе традиционно начинается с титульного листа. В нашем примере это будет текстовая ячейка, содержащая основные данные о выполненной работе и исполнителе (студенте).

      В начале каждого раздела создаём текстовую ячейку с соответствующим названием. Двойным щелчком левой кнопки мыши переходим к редактированию ячейки. Для заголовков первого верхнего уровня используем символ решетки. После ввода текста для «запуска» ячейки на выполнение нажимаем комбинацию клавиш [Shift + Enter]. При этом автоматически создаётся новая кодовая ячейка.

      Чтобы раскрыть структуру документа, нажимаем