Описание
О курсе
Курс посвящен профессиональному инференсу больших языковых моделей: тому, как LLM работают после обучения, как они обрабатывают запросы пользователей, почему возникают задержки, как повысить пропускную способность сервера и какие инженерные решения используются в современных AI-компаниях.
Программа объединяет теорию, лабораторные работы, живые демонстрации и практику на реальном оборудовании. Занятия проводят доктор Радж Дандекар, MIT PhD, а также инженеры и специалисты из Anthropic, NVIDIA, Apple, Microsoft, Amazon, AnyScale и других технологических компаний.
Чему вы научитесь
- Понимать архитектуру современных систем инференса LLM и ключевые этапы обработки запроса.
- Оптимизировать производительность больших языковых моделей по задержке, пропускной способности и использованию GPU.
- Работать с памятью GPU, KV cache, механизмами внимания и ограничениями аппаратных платформ.
- Применять квантизацию моделей для ускорения инференса и снижения потребления ресурсов.
- Использовать популярные фреймворки и инструменты: vLLM, SGLang, FlashAttention, TensorRT-LLM, Ray Serve и Megatron-LM.
- Развертывать LLM на локальном компьютере, сервере, Raspberry Pi 4, Android-устройстве и NVIDIA Jetson Orin Nano.
- Проектировать production-ready AI-сервисы с масштабируемой архитектурой.
- Готовиться к техническим собеседованиям, где проверяют понимание системного дизайна LLM-инференса.
Курс состоит из двух самостоятельных модулей. Первый модуль фокусируется на принципах и оптимизации инференса, второй — на промышленном развертывании и построении прикладных AI-систем.
Модуль 1. Архитектура и оптимизация инференса LLM
В первой части вы изучите, как устроен инференс больших языковых моделей, какие узкие места возникают при обработке запросов и как современные фреймворки помогают повысить эффективность работы моделей.
- Основы инференса LLM и жизненный цикл запроса.
- Prefill, decode, batching и continuous batching.
- KV cache и оптимизация использования памяти.
- Механизмы внимания и FlashAttention.
- Квантизация моделей и компромиссы между скоростью, качеством и потреблением памяти.
- Профилирование производительности и поиск bottleneck-компонентов.
- Практическая работа с vLLM, SGLang, TensorRT-LLM и другими инструментами.
Во второй части курса вы перейдете от оптимизации отдельных моделей к созданию полноценных AI-сервисов, которые можно использовать в реальных продуктах и инфраструктуре.
- Промышленное развертывание LLM-сервисов.
- Распределенные вычисления и масштабирование инференса.
- Ray Serve и подходы к обслуживанию большого числа запросов.
- Edge-инференс на компактных устройствах.
- Запуск моделей на Raspberry Pi 4, Android и NVIDIA Jetson Orin Nano.
- Сравнение аппаратных платформ и анализ производительности.
- Построение надежных production-ready AI-приложений.
Большая часть курса построена вокруг практических заданий. Каждый учебный день сопровождается лабораторными работами в Google Colab, визуальными материалами, демонстрациями и разбором инженерных решений.
Вы будете не только изучать теорию, но и запускать модели, измерять их производительность, анализировать использование ресурсов, сравнивать разные конфигурации и применять методы оптимизации на практике.
Оборудование и платформы
- Локальный компьютер для базового запуска и тестирования моделей.
- Google Colab для лабораторных работ и экспериментов.
- Raspberry Pi 4 для изучения ограничений edge-инференса.
- Android-устройство для запуска LLM на мобильной платформе.
- NVIDIA Jetson Orin Nano для практики с компактным GPU-ускорителем.
В рамках курса вы реализуете два полноценных проекта, которые помогут закрепить навыки разработки и оптимизации систем инференса LLM.
Проект 1. Высокопроизводительный сервер инференса LLM
Вы пройдете полный путь от исходных весов модели до оптимизированного сервиса инференса. В процессе вы настроите запуск модели, проведете профилирование, выявите узкие места, примените техники ускорения и подготовите систему к обработке реальных запросов.
- Загрузка и подготовка модели.
- Настройка сервера инференса.
- Оптимизация latency и throughput.
- Анализ производительности каждого компонента.
- Подготовка сервиса к production-сценариям.
Второй проект посвящен созданию интеллектуального AI-помощника для WhatsApp. Он будет обрабатывать диалоги, генерировать ответы и улучшать свое поведение с помощью обучения с подкреплением на основе пользовательских взаимодействий.
- Интеграция LLM с чат-интерфейсом.
- Разработка логики AI-ассистента.
- Использование диалогов для улучшения качества ответов.
- Применение подходов reinforcement learning в прикладном сценарии.
Во время обучения вы познакомитесь с современным стеком инструментов, который используется для ускорения и масштабирования инференса больших языковых моделей.
- vLLM — высокопроизводительный inference engine для обслуживания LLM.
- SGLang — фреймворк для эффективного выполнения LLM-приложений.
- FlashAttention — оптимизированные механизмы внимания для ускорения работы трансформеров.
- TensorRT-LLM — инструменты NVIDIA для оптимизации инференса больших моделей.
- Ray Serve — решение для масштабируемого serving-а AI-моделей.
- Megatron-LM — фреймворк для работы с крупными языковыми моделями и распределенными вычислениями.
- Google Colab — среда для лабораторных работ и экспериментов.
- ML-инженерам, которые хотят глубже разобраться в оптимизации и развертывании LLM.
- Backend- и infrastructure-инженерам, работающим с AI-сервисами и высоконагруженными системами.
- Data scientists, которые хотят перейти от экспериментов с моделями к production-разработке.
- AI-разработчикам, создающим чат-ботов, ассистентов и LLM-приложения.
- Техническим специалистам, готовящимся к собеседованиям в AI-компании.
- Основателям и техническим лидерам, которым нужно понимать стоимость, ограничения и архитектуру LLM-инференса.
После прохождения курса вы сможете проектировать и внедрять системы инференса LLM, которые учитывают требования к скорости, стоимости, масштабируемости и надежности.
- Понимание внутренних механизмов работы LLM во время инференса.
- Навык оптимизации моделей под разные аппаратные платформы.
- Опыт работы с industry-standard инструментами для LLM serving.
- Умение проводить профилирование и принимать инженерные решения на основе метрик.
- Два практических проекта для портфолио.
- Более уверенная подготовка к техническим интервью по LLM-инфраструктуре.
Разработка больших языковых моделей — это не только обучение нейросетей. В реальных продуктах основная стоимость и сложность часто связаны именно с инференсом: скоростью ответов, нагрузкой на GPU, масштабированием, потреблением памяти и стабильностью сервиса.
Специалисты, которые понимают, как эффективно обслуживать LLM в production, востребованы в командах, создающих AI-ассистентов, корпоративные чат-боты, агентные системы, поисковые продукты, инструменты для разработчиков и другие приложения на базе генеративного искусственного интеллекта.
Язык Английский
ИСТОЧНИК
СКАЧАТЬ
Версия курса с водяными знаками
Вы находитесь на странице товара «Vizuara AI Labs - Dr. Rajat Dandekar → Master LLM Inference (Phase 1: Foundations & Optimization)». Это более доступная версия материала, в которой присутствуют водяные знаки. Такой вариант подходит тем, кому важна минимальная цена и кто готов пользоваться материалом с отметками на видео, скриншотах или других файлах курса.
Материал относится к периоду/дате выхода: 2026. Доступ предоставляется через: Облако Mail.
Главное отличие этой версии — наличие водяных знаков, за счёт чего цена ниже.
Обучающий курс находится в рубрике «Программирование / Vizuara AI Labs». Также на сайте можно найти другие материалы автора «Vizuara AI Labs». Стоимость этой версии на MANY-COURSES.NET составляет 179 рублей.
Похожие курсы
Вопросы и ответы
Как получить курс?
Добавьте курс в корзину или нажмите «Купить», выберите удобный способ оплаты и завершите заказ. После подтверждения оплаты ссылки на материалы автоматически придут на указанную почту. Авторизованные пользователи также найдут купленные материалы в разделе «Мои покупки».
Почему такая цена?
Материалы приобретаются совместно, поэтому стоимость заметно ниже цены автора. Вы получаете запись курса и заявленные материалы для самостоятельного обучения; обратная связь автора обычно не входит, если отдельно не указано обратное.
Нашли дешевле?
Пришлите нам ссылку на более дешёвое предложение — проверим его и постараемся сделать цену ниже. Написать нам о цене.
Где будет доступ к курсу?
Для этого товара указан вид доступа: Облако Mail. После оплаты вы получите нужную ссылку или приглашение.
Можно ли скачать материалы?
Если материалы находятся в облачном хранилище, их обычно можно смотреть онлайн или скачать себе. Исключения зависят от формата конкретного курса.
Есть ли гарантия получения?
После подтверждения оплаты выдача происходит автоматически. Если возникнет вопрос с оплатой или доступом, напишите нам в Telegram, через чат на сайте или на admin@many-courses.net. До покупки по запросу можем показать дополнительные скриншоты или фрагмент содержимого.