<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0" xmlns:yandex="http://news.yandex.ru" xmlns:media="http://search.yahoo.com/mrss/" xmlns:turbo="http://turbo.yandex.ru">
<channel>
<title>karpov.courses - Онлайн курсы от 49 рублей</title>
<link>https://many-courses.net/</link>
<description>karpov.courses - Онлайн курсы от 49 рублей</description><item turbo="true">
<turbo:extendedHtml>true</turbo:extendedHtml>
<link>https://many-courses.net/programmirovanie/17157-karpov-courses-evgeniy-ermakov-valeriy-sokolov-roman-bunin-inzhener-dannyh-obnovlenie-2026.html</link>
<author>Admin</author>
<category>Программирование, karpov.courses</category>
<pubDate>Mon, 24 Aug 2026 16:17:19 +0300</pubDate>
<turbo:content><![CDATA[
<header>
<h1>Karpov.courses - Евгений Ермаков, Валерий Соколов, Роман Бунин → Инженер данных (Обновление 2026)</h1>
</header>
<b>Инженерия данных от проектирования до нетривиальной обработки.</b><br> <br> Научитесь правильно готовить данные любых размеров и сложности.<br> Обучающие выборки для машинного обучения и красивые графики для отчётов не появляются сами собой: данные нужно собирать, хранить, валидировать и комбинировать между собой, быстро реагируя на изменения в их структуре.<br> <br> Наша программа создана для профессионалов, которые стремятся к системному проектированию сложных решений. Вы будете работать с задачами, которые требуют не базовых навыков, а глубокого понимания инструментов и архитектуры.<br> Для эффективной работы с данными одного инструмента недостаточно — необходимо учитывать все взаимосвязи большого хранилища, понимать потребности заказчика и воспринимать данные как конечный продукт.<br> Сильный инженер данных за счёт широты знаний и понимания архитектуры DWH способен подобрать правильные инструменты под любые задачи и донести результат до потребителей данных.<br> <br> <b>Кому подойдет этот курс:</b><br> Он ориентирован на тех, кто уже имеет практический опыт в работе с данными и хочет перейти от решения отдельных задач к проектированию сквозных систем<br> <ul> <li>Аналитик данных<br> Вы уже постоянно взаимодействуете с базами данных, но хотите лучше разобраться в ETL-процессах и выйти на качественно новый уровень в аналитике</li> </ul><ul> <li>Инженер данных<br> Работаете с хранилищами данных, но хотите систематизировать знания и глубже погрузиться в актуальные технологии</li> </ul><ul> <li>BI-разработчик<br> Занимаетесь развитием систем бизнес-аналитики, хотите освоить архитектуру современных хранилищ данных и научиться их проектировать</li> </ul><ul> <li>Backend-разработчик<br> Имеете опыт бэкенд-разработки и хотите применить его для решения задач, связанных с хранением и обработкой больших данных</li> </ul><b>Какие инструменты освоите:</b><br> <br> Хранение<br> <ul> <li>Hadoop</li> <li>S3</li> <li>Greenplum</li> <li>PostgreSQL</li> </ul>Обработка<br> <ul> <li>Python</li> <li>SQL</li> <li>Hive</li> <li>Spark</li> <li>Kafka</li> </ul>Машинное обучение<br> <ul> <li>ML Flow</li> <li>Spark ML</li> </ul>Визуализация<br> <ul> <li>SuperSet</li> <li>Tableau</li> <li>DataLens</li> </ul>Оркестраторы<br> <ul> <li>Airflow</li> </ul><b>Программа<br> <br> Проектирвоание DWH</b><br> Data Warehouse — централизованное хранилище данных из разных источников. Познакомимся с его верхнеуровневой логической архитектурой, рассмотрим её основные компоненты и разберём на практике разные подходы к проектированию детального слоя DWH.<br> <br> 1. Архитектура DWH<br> Узнаем, что такое хранилище данных, как оно устроено и зачем в нём столько слоев. Обсудим и сравним подходы Инмона и Кимбалла к построению DWH.<br> <br> Нормальные формы<br> Познакомимся с важными аспектами теории нормальных форм, процессами нормализации и денормализации баз данных.<br> <br> Методология Dimensional Modeling<br> Многомерное моделирование является классическим подходом к созданию витрин данных. Рассмотрим популярные схемы — «звезда», «снежинка» и «созвездие». Обсудим таблицы фактов и измерений, поговорим о вариантах хранения медленно меняющихся измерений.<br> <br> Проектирование логической модели DWH<br> Спроектируем и опишем предметную область с помощью пройденных методологий.<br> <br> Методология Data Vault<br> Data Vault — один из современных подходов к проектированию хранилищ данных. Рассмотрим особенности и предпосылки возникновения новой методологии. Обсудим основные сущности Data Vault — Hub, Link, Satellite.<br> <br> Методология Anchor Modeling<br> Если довести нормализацию до предельной формы, получится Anchor Modeling. Рассмотрим особенности этой методологии и обсудим её основные сущности — Anchor, Link, Knot, Attribute<br> <br> Сравнение методологий проектирования<br> Сравним все рассмотренные подходы и выясним, как выбрать оптимальный для решения конкретной задачи.<br> <b><br> Реляционные и MPP СУБД</b><br> Начнём погружение в инженерию данных со знакомства с реляционными и MPP базами данных. Рассмотрим их архитектуру, обсудим популярные решения и узнаем, в каких случаях MPP СУБД оказываются лучше традиционных. Научимся готовить PostgreSQL и MPP базы данных на примере Greenplum.<br> <br> 1. Архитектура реляционных MPP баз данных<br> Рассмотрим, как устроены реляционные и MPP базы данных, и узнаем, для каких задач они подходят.<br> <br> 2. Объекты баз данных<br> Поговорим о таблицах и индексах, обсудим последовательности и возможные триггеры, рассмотрим процедуры и функции.<br> <br> 3. Подключение к PostgreSQL и Greenplum. Работа со словарем данных<br> Познакомимся с популярными клиентами для подключения к PostgreSQL и Greenplum. Посмотрим на основные объекты словаря данных и их содержимое. Научимся с помощью запросов получать информацию об объектах базы данных.<br> Создадим кластер PostgreSQL, создадим таблицы и выполним запросы к ним.<br> <br> 4. Обработка запросов в традиционных и MPP СУБД<br> Обсудим особенности построения запросов и научимся проводить анализ плана запроса. Поговорим об эффективных способах получения данных из Greenplum, разберёмся, чем Greenplum отличается от обычных реляционных баз данных, и рассмотрим особенности других популярных решений.<br> <br> 5. Обработка запросов в традиционных и MPP СУБД<br> Подключимся к кластеру Greenplum при помощи любого клиента (например, DBeaver). Изучим объекты в схеме tpch1. Построим план запроса, выполним "explain analyze", оценим фактические затраты на выполнение запроса и сформулируем выводы.<br> <br> 6. Применение R, Python и GeoSpatial в расчетах на Greenplum<br> Научимся проводить расчёты на R и Python прямо внутри Greenplum. Поработаем с пространственными объектами при помощи библиотеки PostGIS.<br> <br> 7. Применение R, Python и GeoSpatial в расчетах на Greenplum<br> Используя различные операторы и функции в GreenPlum, найдем информацию об имеющихся данных.<br> <b><br> Автоматизация ETL-ПРОЦЕССОВ</b><br> ETL — ключевой процесс в управлении хранилищами данных. Рассмотрим принципы и основные этапы его построения. Познакомимся с популярным инструментом Airflow, подробно разберём его основные компоненты и научимся с его помощью автоматизировать ETL-пайплайны.<br> <br> 1. ETL-процессы<br> Рассмотрим основные принципы построения ETL-процессов и познакомимся с планировщиками задач (шедулерами).<br> <br> 2. Знакомство с Airflow<br> Познакомимся с Airflow — инструментом для оркестровки ETL-процессов. Рассмотрим его основные компоненты: воркер, шедулер, веб-сервер, базу данных. Создадим в Airflow несколько задач (тасков), объединим их в цепочку (DAG) и посмотрим, как это работает на практике.<br> <br> 3. Сложные пайплайны, часть 1.<br> Скачаем репозиторий, настроим IDE для работы с ним. Создадим даг из нескольких тасков. Запушим даг в репозиторий и убедимся, что даг появился в интерфейсе airflow и отрабатывает без ошибок.<br> <br> 4. Сложные пайплайны, часть 2.<br> Для более сложных пайплайнов в Airflow есть дополнительные инструменты: сабдаги и группы тасков для группировки задач, Trigger Rules и BranchPythonOperator для настраивания правил, Jinja для параметризации и XCom для передачи данных между тасками. Научимся использовать все эти инструменты в работе.<br> Доработаем даг, который создали на прошлом занятии по заданным параметрам.<br> <br> 5. Разработка своих плагинов<br> В Airflow есть много готовых операторов, но иногда требуется автоматизировать работу с API или реализовать свой обработчик для стандартного источника. Научимся писать собственные хуки, операторы и сенсоры.<br> С помощью API найдём три особенные локации сериала "Рик и Морти".<br> <br> 6. Установка и настройка Airflow<br> Есть несколько способов развернуть Airflow: просто запустить pip3 install apache-airflow, развернуть готовый докер-образ или организовать хайлоад с кластеризацией. Обсудим плюсы и минусы каждого подхода. Посмотрим, какие настройки есть у Airflow, и научимся управлять инструментом через интерфейс командной строки.<br> <b><br> BIG DATA</b><br> Познакомимся с механизмами распределённого хранения больших данных на базе Hadoop, разберём основные паттерны реализации их распределённой обработки. Рассмотрим вопросы отказоустойчивости и восстановления после сбоев. Поговорим о потоковой обработке данных, методах и средствах мониторинга и профилирования заданий Spark.<br> <br> 1. Основы Hadoop. HDFS<br> Подробно рассмотрим Hadoop Distributed File System — реализацию идеи распределённого отказоустойчивого хранения в Hadoop экосистеме.<br> <br> 2. Основы Hadoop/ YARN, MapReduce<br> Познакомимся с универсальным менеджером ресурсов YARN, рассмотрим реализацию MapReduce парадигмы, обсудим её сильные и слабые стороны.<br> <br> 3. Основы Hadoop. YARN, MapReduce<br> Создадим S3 бакет в Object Storage и скопируем в него данные. Напишем map-reduce приложение, вычисляющее отчет на каждый месяц 2020 года определённого вида.<br> <br> 4. Hive. SQL для Big Data<br> Обсудим применение SQL на больших данных, рассмотрим всё от запросов до уровней хранения.<br> <br> 5. Hive. SQL для Big Data<br> Создадим S3 бакет в Object Storage и скопируем в него данные. После этого создим БД, зарегистрируем таблицу, подключимся к вашему hive и выполним SQL запрос.<br> <br> 6. HBase. Масштабируемая колоночная база данных.<br> Поговорим о NoSQL базах данных и рассмотрим колоночную базу данных в Hadoop.<br> <br> 7. Основы Spark<br> Познакомимся с основными идеями Spark, обсудим его отличия от MapReduce, поговорим про модель вычислений и RDD.<br> <br> 8. Spark SQL. Dataframes<br> Обсудим Spark Dataframe и научимся использовать SQL в Spark.<br> <br> 9. Основы Spark<br> Изучим данные от авиакомпанни и построим сводные таблицы при помощи Apache Spark.<br> <br> 10. Kafka. Spark Streaming<br> Поработаем с Kafka — масштабируемым брокером сообщений. Научимся обрабатывать данные на лету с помощью Spark Streaming.<br> <br> 11. Отладка, профилирование и мониторинг Spark Job<br> <b><br> Промежуточный проект</b><br> Для эффективной отработки навыков в курсе «Инженер данных» есть промежуточный практический проект, который воссоздает etl-процессы (airflow) крупной двухуровневой платформы данных. Проект максимально приближен по сути к рабочим задачам дата-инженера. В процессе работы над ним вы закрепите понимание инструментов airflow, spark + s3 и greenplum и поймете, как использовать их в связке друг с другом.<br> Проект доступен тем, кто прошел модуль Big data, на его выполнение дается две недели — в этот период не будут открываться другие уроки, чтобы вы не отвлекались.<br> <b><br> Облачное хранилище</b><br> Рассмотрим облачные решения и инструменты для построения DWH и Data Lake. Познакомимся с Kubernetes и научимся применять его для работы с данными. Поработаем с облаком на практике, рассмотрим процесс установки и настройки JupyterHub и Spark в Kubernetes.<br> <br> 1. Введение в облако<br> Поговорим об основных моделях облачных услуг: IaaS, PaaS, SaaS. Обсудим основы создания и использования виртуальных машин и сервисов. На практике рассмотрим работу виртуальных машин в облаке.<br> <br> 2. Введение в облако<br> Сделаем минимум для фундамента инфраструктуры в облаке - развернем виртуальную машину.<br> <br> 3. Облачная инфраструктура<br> Разберём ключевые особенности облачной инфраструктуры в контексте работы с данными. Выясним, на что стоит обращать внимание при разворачивании Hadoop, ClickHouse и Greenplum в облаке. Самостоятельно развернём и протестируем несколько систем.<br> Установим MLflow на VM, развернём Postgres в облаке, используя DBaaS, создадим S3 бакет. Далее запустим MLflow и установим JupyterHub на VM.<br> <br> 4. Особенности решений для работы с данными в облаках<br> Познакомимся с BigQuery, Snowflake, AWS Athena и другими популярными инструментами. Рассмотрим архитектуру хранилищ данных в облаках, обсудим традиционный и облачный подходы, поговорим про разнесение данных на слои.<br> <br> 5. Kubernetes для инженерии данных<br> Рассмотрим основной функционал Kubernetes, поговорим про его архитектуру и базовые абстракции. Обсудим имеющиеся в нём инструменты для инженерии данных — Spark, Airflow, Presto. Поработаем в облаке с кластером Kubernetes, развернём и протестируем в нём Spark и JupyterHub.<br> <br> 6. Kubernetes для инженерии данных<br> Создадим кластер, работать с ним будем с VM. Скопируем на VM kubeconfig. И в завершение установим JupyterHub и проверим его работоспособность в Kubernetes.<br> <br> 7. Разворачиваем Spark в Kubernetes<br> В кластере Kubernetes установим Spark Operator. Запустим своё приложение, которое прочитает данные из S3 и переложит их в другой бакет. Установим Spark History Server в Kubernetes и запустим приложение Spark, которое будет писать логи в Spark History Server.<br> <b><br> Визуализация данных</b><br> Рассмотрим основные принципы работы с данными с точки зрения их визуализации и научимся смотреть на данные глазами их потребителя. Познакомимся с Tableau — гибким и мощным BI-инструментом. Узнаем, как он взаимодействует с базами данных, и построим с его помощью интерактивный дашборд для мониторинга DWH платформы.<br> <br> 1. Зачем нужна визуализация. Основы Tableau<br> Разберёмся, зачем инженеру данных нужно изучать визуализацию, и поймём, какие бизнес-задачи она решает. Рассмотрим основные виды графиков и научимся строить их в Tableau.<br> <br> 2. Как сделать дашборд<br> Узнаем, какие существуют виды дашбордов, и познакомимся с базовыми правилами вёрстки и графического дизайна. Попробуем сделать свой дашборд в Tableau.<br> Разработаем дашборд по датасету с вакансиями аналитиков, состоящий минимум из трёх графиков.<br> <br> 3. Сбор требований. Dashboard Canvas<br> Узнаем, как правильно собирать требования для дашборда, чтобы он решал задачи пользователя. Познакомимся с фреймворком Dashboard Canvas и рассмотрим примеры его применения.<br> <br> 4. Подключение данных к Tableau<br> Посмотрим, как Tableau работает с данными, и узнаем, какие существуют модели данных и способы подключения к источникам. Рассмотрим запросы Tableau при подключении к базам данных в различных сценариях.<br> <br> 5. Кейсы. Разработка внутренних дашбордов по DWH<br> Обсудим, как с помощью дашбордов и KPI можно управлять DWH и BI как продуктами и улучшать качество работы этих систем.<br> <br> 6. Обзор DataLens и SuperSet<br> <b><br> BIG ML</b><br> Познакомимся с теорией распределённого машинного обучения. Научимся работать с популярным модулем Spark ML и рассмотрим подходы к обучению и применению моделей на больших данных.<br> <br> 1. Введение в машинное обучение<br> Рассмотрим базовые концепции машинного обучения. Разберёмся, как происходит обучение моделей, и узнаем, какую роль в этом процессе играют инженеры данных.<br> <br> 2. Теория распределенного обучения<br> Обсудим и сравним подходы к распределённому машинному обучению — Model Distributed и Data Distributed.<br> <br> 3. Spark ML<br> Познакомимся с реализацией распределённого машинного обучения на примере Spark ML. Научимся применять такие важные компоненты, как Transformers, Estimators, Pipeline, HT.<br> <br> 4. Spark ML<br> Решите 2 задачи при помощи Spark ML: о кредитном скоринге и кредитной оценке<br> <br> 5. Применение нераспределенных ML-моделей на больших данных<br> Создадим Pandas UDF функцию, которая должна будет частично скрывать номера банковских карт.<br> <br> 6. Идентификация ботов<br> Займёмся задачей идентификацией ботов среди пользовательских сессий.<br> <b><br> Управление моделями</b><br> В работе инженеры часто сталкиваются с подготовкой данных для обучения ML-моделей. Рассмотрим инструменты для построения ML-пайплайнов, версионирования датасетов, организации учёта и трекинга моделей.<br> <br> 1. Пайплайн обучения ML-модели<br> Рассмотрим основные этапы общего пайплайна обучения любой модели. Разберёмся, зачем готовить датасеты и как управлять этим процессом. Обсудим проблемы, с которыми сталкиваются при обучении моделей — воспроизводимость экспериментов, трекинг, протухание.<br> <br> 2. Версионирование данных (DVC)<br> Обсудим методы и подходы к версионированию данных на примере Data Version Control (DVC). Научимся вести версионирование датасетов и пользоваться ими.<br> Зарегистрируем файл данных в DVC, разместим в удаленном хранилище и выполним коммит изменений в вашей ветке, отправим изменения в репозиторий. Запустим проверку решения.<br> <br> 3. Применение MLFlow для учета и трекинга моделей<br> Научимся применять MLFlow для сохранения и выгрузки моделей в процессе проведения над ними экспериментов.<br> Возьмём задачу автоматизации процессов страховой компании. Добавим разметку эксперимента для трекинга процесса обучения модели в MLFlow.<br> <b><br> Управление данными</b><br> На практике часто приходится иметь дело с разными данными и огромным числом интеграций и процессов, выполняющих над ними те или иные преобразования. Познакомимся с популярными подходами к управлению данными, обсудим инструменты для контроля качества данных и отслеживания их происхождения.<br> <br> 1. Data Management<br> Поговорим об управлении данными, рассмотрим составляющие этого процесса и узнаем, почему он так важен.<br> <br> 2. Data Security<br> Данные — один из важнейших активов любой компании. Обсудим подходы, применяемые для обеспечения их безопасности.<br> <br> 3. Data Quality<br> Чтобы с данными было удобно работать, они должны отвечать определённым требованиям к их качеству. Разберёмся, что такое Data Quality и как его оценивать.<br> <br> 4. Deequ для DataQuality<br> Используя возможности pydeequ, разработаем задачу по анализу данных и сохранению отчета с анализом в папку.<br> <br> <b>ИСТОЧНИК<br> </aside> <br> СКАЧАТЬ<br> </aside> </b>
]]></turbo:content>
</item><item turbo="true">
<turbo:extendedHtml>true</turbo:extendedHtml>
<link>https://many-courses.net/programmirovanie/10876-karpov-courses-darya-lukashevskaya-superset-sozdanie-dashbordov-dlya-biznesa.html</link>
<author>Admin</author>
<category>Программирование, karpov.courses</category>
<pubDate>Thu, 15 Jan 2026 14:16:52 +0300</pubDate>
<turbo:content><![CDATA[
<header>
<h1>karpov.courses - Дарья Лукашевская → Superset: создание дашбордов для бизнеса</h1>
</header>
<b>Создавайте эффективные дашборды, которые решают бизнес-задачи.</b><br> Освойте Apache Superset и создавайте интерактивные дашборды с кастомными визуализациями, геоданными и продвинутыми фильтрами после курса обучения. Узнайте, как работать с большими объёмами данных и оптимизировать отчеты для бизнеса.<br> Прокачайте навык визуализации данных и превращайте аналитику в понятные решения.<br> <br> <b>Кому подойдёт этот курс:</b><br> <ul> <li>Аналитикам<br> Хотите научиться создавать интерактивные дашборды, которые отвечают на ключевые бизнес-вопросы? Этот курс поможет вам освоить Superset, чтобы вы могли автоматизировать свою работу и продвигаться в карьере<br> <br> </li> <li>Инженерам данных<br> Занимаетесь обработкой данных и подготовкой витрин? Курс научит вас создавать дашборды, которые идеально дополняют ваши решения и интегрировать их с вашей инфраструктурой</li> </ul><ul> <li>Дата-сайентистам<br> Ищете способ визуализировать результаты своих моделей и экспериментов? Знание Superset поможет вам представлять сложные данные, в понятной форме, что сделает ваши проекты еще более убедительными<br> <br> </li> <li>Менеджерам продуктов и проектов<br> Хотите лучше понимать, как работают данные и как визуализация помогает принимать решения? Этот курс позволит вам научиться создавать простые дашборды самостоятельно и эффективно ставить задачи аналитикам</li> </ul><b>Чему научитесь:</b><br> <ul> <li>Создавать эффективную визуализацию<br> Сможете строить дашборды, которые не только выглядят красиво, но и отвечают на важные бизнес-вопросы<br> <br> </li> <li>Оптимизировать работу с BIG Data<br> Разберетесь, как настраивать запросы и использовать фильтры для быстрой работы с большими объемами данных</li> </ul><ul> <li>Визуализировать географические данные<br> Научитесь работать с картами, добавлять географические слои, визуализировать региональные данные и интегрировать их с другими источниками<br> <br> </li> <li>Работать с SQL для создания витрин<br> На курсе вы получите навыки написания запросов, которые подготавливают данные для создания дашбордов, оптимизируя их для визуализации</li> </ul><ul> <li>Интегрировать дашборды с инфраструктурой<br> Освоите подключение внешних источников данных и настройку Superset для сложных бизнес-решений. В этом курсе мы будем работать с данными в PostgreSQL и ClickHouse<br> <br> </li> <li>Использовать продвинутые функции Superset<br> Научитесь настраивать кастомные визуализации, использовать advanced фильтры и работать с временными данными</li> </ul><b>Программа</b><br> <br> <b>Неделя 1. Введение в SuperSet. Подключение данных и создание базовых графиков</b><br> На этом этапе вы познакомитесь с Apache Superset, узнаете в чем его преимущества и отличия от других инструментов, а также для каких задач подходит Superset. Подключите источники данных, создадите свои первые датасеты и построите базовые графики для анализа временных рядов<br> <br> <b>Неделя 2. Создание продвинутых графиков. Форматирование и фильтрация дашбордов</b><br> Освоите продвинутые графики, такие как heatmap и pivot table. Научитесь собирать их в интерактивный дашборд: добавите фильтры, настроите кросс-фильтрацию, визуализируете данные на карте и примените кастомное форматирование<br> <br> <b>Неделя 3. Создание продвинутых датасетов. Настройка доступов и ролей</b><br> Научитесь объединять данные из нескольких источников в одном дашборде. Узнаете, как создавать пользовательские роли и разрешения к ним, а также как разграничивать доступ к дашбордам и данным<br> <br> <b>Неделя 4. Автоматизация и кастомизация</b><br> На этом этапе вы научитесь кастомизировать внешний вид дашбордов с помощью CSS, настраивать автоматическое обновление данных и интегрировать Superset в бизнес-процессы через автоматические отчёты и алерты, а также как применять jinja-фильтры<br> <br> <b>Неделя 5. Финальный проект</b><br> Создадите полноценный аналитический дашборд на основе собственного набора данных с использованием всех изученных возможностей<br> <br> <b>ИСТОЧНИК<br> </aside> <br> СКАЧАТЬ<br> </aside> </b>
]]></turbo:content>
</item><item turbo="true">
<turbo:extendedHtml>true</turbo:extendedHtml>
<link>https://many-courses.net/programmirovanie/8694-karpov-courses-inzhener-dannyh-s-nulya.html</link>
<author>Admin</author>
<category>Программирование, karpov.courses</category>
<pubDate>Tue, 09 Dec 2025 12:48:53 +0300</pubDate>
<turbo:content><![CDATA[
<header>
<h1>karpov.courses - Инженер данных с нуля</h1>
</header>
<b>Освойте востребованную профессию инженера данных за 6 месяцев</b><br> Пройдите собеседование на позицию junior инженера-данных<br> <br> <b>Чем занимается инженер данных:</b><br> Данные — основа всего. Сбор данных позволяет выявлять потребности, разрабатывать оптимальные решения, прогнозировать риски и даже оценивать состояние здоровья.<br> Но данные нужно не только собирать — их нужно преобразовывать, структурировать, автоматизировать и хранить. Именно здесь и появляются инженеры данных — чтобы создавать инфраструктуру, работать с хранилищами данных и подготавливать данные к дальнейшей обработке.<br> Уже на старте профессия инженера данных предлагает достаточно высокие зарплаты по сравнению с другими специалистами сферы Data Science.<br> <br> <b>Кому подойдет курс</b><br> <ul> <li>Новичок в IT<br> Погрузитесь в тему, освоите основные инструменты и начнете карьеру в одном из востребованных направлений.</li> <li>Начинающий инженер данных<br> Получите структурированное понимание теории, закрепите владение инструментами и освоите новые, изучите актуальные технологии работы с данными.</li> </ul><b>Чему научитесь</b><br> <ul> <li>Работать с SQL</li> <li>Писать код на Python</li> <li>Использовать Postgre, Clickhouse и pySpark</li> <li>Понимать цели и ставить задачи DWH в рамках организации</li> <li>Строить ETL-процессы в Airflow</li> </ul><b>Программа курса</b><br> Профессия инженера данных — универсальная специальность, которая позволяет работать в разных сферах. В нашем курсе мы даем все необходимое для уверенного старта карьеры — не просто учим писать код и считать метрики, а рассказываем, как с помощью этих знаний приносить пользу своему работодателю.<br> <br> 1. Интро<br> автор: Евгений Ермаков<br> Продолжительность: 2 академических часа<br> Получите основную информацию о профессии инженера данных и начнете свой путь обучения.<br> <br> 2. SQL<br> автор: Дина Сафина<br> Продолжительность: 3.5 недели количество уроков: 10 уроков<br> Освоите основный язык работы с данными, разберете принципы взаимодействия с ним, от простых<br> select до сложных запросов с join и оконными функциями. Пройдете первое техническое<br> собеседование с тестовым заданием.<br> <br> 3. Linux<br> автор: Александр Волынский<br> Продолжительность: 1 неделя количество уроков: 3 урока<br> Познакомитесь с командной строкой и освоите базовые команды.<br> <br> 4. БД, СУБД<br> автор: Евгений Ермаков<br> Продолжительность: 5,5 недель количество уроков: 20 уроков<br> Рассмотрите теоретические основы построения баз данных, познакомитесь<br> с реляционными базами данных, освоите Postgre и ClickHouse. Пройдете технические собеседования и выполните тестовые задания по теме.<br> <br> 5. Git, GitHub<br> автор: Александр Волынский<br> Продолжительность: 1 неделя количество уроков: 3 урока<br> Научитесь работать с локальным и удаленным репозиторием. Поймете основные принципы коммуникации.<br> <br> 6. Python<br> автор: Александр Савченко<br> Продолжительность: 5.5 недель количество уроков: 15 уроков<br> Освоите базовые понятия Python, которые пригодятся для прохождения тестового задания и для<br> работы с AirFlow. Пройдете техническое собеседование с тестовым заданием.<br> <br> 7. pySpark<br> автор: Александр Волынский<br> Продолжительность: 2 недели количество уроков: 4 урока<br> Изучите концепцию dataframe. Научитесь работать с данными.<br> Пройдете техническое собеседование с тестовым заданием.<br> <br> 8. AirFlow<br> автор:Дина Сафина<br> Продолжительность: 2.5 недели количество уроков: 4 урока<br> Познакомитесь с популярным инструментом и научитесь с его помощью автоматизировать<br> ETL -пайплайны. Пройдете техническое собеседование с тестовым заданием.<br> <br> 9. DWH<br> автор: Евгений Ермаков<br> Продолжительность: 1 неделя количество уроков: 10 уроков<br> Рассмотрите основные компоненты архитектуры централизованного хранилища данных.<br> <br> 10. Защита проекта<br> автор: Александр Савченко<br> Продолжительность: 3 недели<br> Построите сводный отчет по продажам, используя приобретенные навыки сбора и обработки `<br> данных. Пройдете итоговое тестовое собеседование. А также реальное собеседование на позицию<br> инженера данных — при условии набора определенного количества баллов.<br> <br> <b>Преподаватели курса Инженер данных с нуля</b><br> <b>Евгений Ермаков</b>. Руководитель платформы данных toloka.ai<br> <b>Дина Сафина</b>. Руководитель группы обработки и анализа больших данных, Ozon.Fintech<br> <b>Александр Савченко</b>. Руководитель R&amp;D в Сбер<br> <b>Александр Волынский</b> - Технический менеджер ML сервисов в VK Cloud.<br> <br> <b>ИСТОЧНИК<br> </aside> <br> СКАЧАТЬ<br> </aside> </b>
]]></turbo:content>
</item></channel></rss>