Курс "Специалист по искусственному интеллекту". Урок 5. Подготовка данных - разведочный анализ (EDA)
Пятый урок курса «Специалист по искусственному интеллекту». Подробно разбираем этап подготовки данных перед обучением моделей. Знакомимся с библиотекой Pandas (структуры Series и DataFrame), проводим первичный разведочный анализ (EDA) на примере реального датасета аренды квартир в Москве с ЦИАН, выявляем аномалии, пропуски и исследуем структуру признаков. 00:00 — Введение: важность подготовки данных и принцип GIGO («Garbage In, Garbage Out») 01:17 — Почему качество модели полностью зависит от исходных данных 01:46 — Жизненный цикл ML-проекта: сколько времени занимает подготовка данных 02:03 — Сбор данных: источники (файлы, базы данных, API, веб-скрапинг) 03:25 — Безопасность данных: как обезличить датасет перед обучением модели 05:33 — Почему этап EDA занимает до 80% времени дата-сайентиста 07:21 — Опыт судейства хакатонов: как подготовка данных определяет победу 09:37 — Поиск открытых наборов данных: Kaggle, Hugging Face, Росстат 16:23 — Библиотека Pandas: почему это фундаментальный инструмент аналитика 19:02 — Ключевые структуры данных в Pandas: Series и DataFrame 20:24 — Подключение необходимых библиотек на Python (NumPy, Pandas, Seaborn) 23:32 — Загрузка реального датасета аренды квартир в Москве с ЦИАН (read_csv) 24:50 — Обзор структуры и размерности датасета ЦИАН 31:02 — Разведочный анализ данных (EDA): цели и задачи первичного осмотра 35:56 — Отбор признаков: какие колонки (ID, телефон, ссылки) нужно сразу отбросить 39:52 — Практические методы Pandas: shape, head и tail 42:08 — Вывод названий признаков (columns) и типов данных (dtypes) 56:00 — Использование describe() для получения первичной статистики по числовым колонкам 59:10 — Выявление аномалий и выбросов на примере высоты потолков в 28 метров 10:10 — Диагностика и подсчет пропущенных значений в таблице (isna().sum()) 11:00 — Визуальный анализ «дыр» в данных с помощью тепловой карты Seaborn (sns.heatmap) 13:02 — Исследование категориальных признаков: уникальные значения (unique и value_counts) 14:24 — Проверка сбалансированности классов и визуализация гистограмм (sns.histplot) 16:23 — Практическое задание для самостоятельной работы со своим датасетом Приветствуем на пятом занятии курса «Специалист по искусственному интеллекту»! Существует золотое правило машинного обучения: «Garbage In, Garbage Out» (GIGO) — мусор на входе дает мусор на выходе. Качество любой прогнозной модели напрямую зависит от чистоты и качества данных, на которых она обучалась. Именно поэтому до 80% времени работы дата-сайентиста занимает подготовка данных, их очистка и разведочный анализ (EDA). В этой лекции мы подробно разберем: – Жизненный цикл ML-проекта и место подготовки данных в нем. – Источники сбора данных: от файлов (CSV, Excel) и баз данных (SQL) до парсинга веб-страниц (веб-скрапинг). – Системы хранения открытых датасетов: Kaggle, Hugging Face, Google Dataset Search. – Инструменты Pandas: почему эта библиотека является стандартом индустрии и как она работает поверх массивов NumPy. – Разницу между Series (одномерными структурами) и DataFrame (двумерными таблицами). – Практический разведочный анализ (EDA) на примере реальной базы данных аренды жилья в Москве с ЦИАН (более 5400 строк и 25 признаков). – Первичный осмотр датасета в Google Colab с помощью методов shape, head(), tail() и columns. – Диагностику типов данных (dtypes) и выявление заведомо нерелевантных признаков (ID, телефоны, ссылки), которые необходимо удалить. – Сбор первичных статистик при помощи describe() и поиск аномалий (разбор примера с высотой потолков в 28 метров). – Оценку масштаба пропущенных значений (NaN) с помощью isna().sum() и визуализацию распределения пропусков тепловой картой Seaborn. – Исследование уникальных категориальных признаков через unique(), value_counts() и визуальный анализ сбалансированности классов с помощью гистограмм. В конце занятия вас ждет небольшая самостоятельная работа для закрепления навыков разведочного анализа на вашем собственном или демонстрационном датасете. Сайт автора курса: https://leolukin.ru
Пятый урок курса «Специалист по искусственному интеллекту». Подробно разбираем этап подготовки данных перед обучением моделей. Знакомимся с библиотекой Pandas (структуры Series и DataFrame), проводим первичный разведочный анализ (EDA) на примере реального датасета аренды квартир в Москве с ЦИАН, выявляем аномалии, пропуски и исследуем структуру признаков. 00:00 — Введение: важность подготовки данных и принцип GIGO («Garbage In, Garbage Out») 01:17 — Почему качество модели полностью зависит от исходных данных 01:46 — Жизненный цикл ML-проекта: сколько времени занимает подготовка данных 02:03 — Сбор данных: источники (файлы, базы данных, API, веб-скрапинг) 03:25 — Безопасность данных: как обезличить датасет перед обучением модели 05:33 — Почему этап EDA занимает до 80% времени дата-сайентиста 07:21 — Опыт судейства хакатонов: как подготовка данных определяет победу 09:37 — Поиск открытых наборов данных: Kaggle, Hugging Face, Росстат 16:23 — Библиотека Pandas: почему это фундаментальный инструмент аналитика 19:02 — Ключевые структуры данных в Pandas: Series и DataFrame 20:24 — Подключение необходимых библиотек на Python (NumPy, Pandas, Seaborn) 23:32 — Загрузка реального датасета аренды квартир в Москве с ЦИАН (read_csv) 24:50 — Обзор структуры и размерности датасета ЦИАН 31:02 — Разведочный анализ данных (EDA): цели и задачи первичного осмотра 35:56 — Отбор признаков: какие колонки (ID, телефон, ссылки) нужно сразу отбросить 39:52 — Практические методы Pandas: shape, head и tail 42:08 — Вывод названий признаков (columns) и типов данных (dtypes) 56:00 — Использование describe() для получения первичной статистики по числовым колонкам 59:10 — Выявление аномалий и выбросов на примере высоты потолков в 28 метров 10:10 — Диагностика и подсчет пропущенных значений в таблице (isna().sum()) 11:00 — Визуальный анализ «дыр» в данных с помощью тепловой карты Seaborn (sns.heatmap) 13:02 — Исследование категориальных признаков: уникальные значения (unique и value_counts) 14:24 — Проверка сбалансированности классов и визуализация гистограмм (sns.histplot) 16:23 — Практическое задание для самостоятельной работы со своим датасетом Приветствуем на пятом занятии курса «Специалист по искусственному интеллекту»! Существует золотое правило машинного обучения: «Garbage In, Garbage Out» (GIGO) — мусор на входе дает мусор на выходе. Качество любой прогнозной модели напрямую зависит от чистоты и качества данных, на которых она обучалась. Именно поэтому до 80% времени работы дата-сайентиста занимает подготовка данных, их очистка и разведочный анализ (EDA). В этой лекции мы подробно разберем: – Жизненный цикл ML-проекта и место подготовки данных в нем. – Источники сбора данных: от файлов (CSV, Excel) и баз данных (SQL) до парсинга веб-страниц (веб-скрапинг). – Системы хранения открытых датасетов: Kaggle, Hugging Face, Google Dataset Search. – Инструменты Pandas: почему эта библиотека является стандартом индустрии и как она работает поверх массивов NumPy. – Разницу между Series (одномерными структурами) и DataFrame (двумерными таблицами). – Практический разведочный анализ (EDA) на примере реальной базы данных аренды жилья в Москве с ЦИАН (более 5400 строк и 25 признаков). – Первичный осмотр датасета в Google Colab с помощью методов shape, head(), tail() и columns. – Диагностику типов данных (dtypes) и выявление заведомо нерелевантных признаков (ID, телефоны, ссылки), которые необходимо удалить. – Сбор первичных статистик при помощи describe() и поиск аномалий (разбор примера с высотой потолков в 28 метров). – Оценку масштаба пропущенных значений (NaN) с помощью isna().sum() и визуализацию распределения пропусков тепловой картой Seaborn. – Исследование уникальных категориальных признаков через unique(), value_counts() и визуальный анализ сбалансированности классов с помощью гистограмм. В конце занятия вас ждет небольшая самостоятельная работа для закрепления навыков разведочного анализа на вашем собственном или демонстрационном датасете. Сайт автора курса: https://leolukin.ru
