Подписывайтесь на Telegram-канал Анатолия Половинкина основателя компании TolkaDigital
Главная - Глоссарий - Машинное обучение

Машинное обучение

Machine Learning, ML

Машинное обучение — раздел искусственного интеллекта, где алгоритмы автоматически улучшают точность предсказаний на основе анализа данных, без явного программирования каждого правила вручную. Чем больше примеров получает алгоритм, тем точнее его предсказания — это принципиально отличает подход от классического программирования, где все условия прописывает разработчик.

Что такое машинное обучение

В классическом программировании разработчик прописывает каждое правило: «если скидка больше 20%, показывать красный баннер». В машинном обучении алгоритм сам находит такие закономерности, анализируя тысячи примеров. Например, модель получает историю покупок 100 000 пользователей и самостоятельно выясняет, что клиенты, купившие кроссовки, в 67% случаев добавляют носки в корзину в течение 14 дней. Этот принцип — обучение на примерах вместо программирования правил — и отличает МО от традиционного подхода. Чем больше образцов поступает на вход, тем точнее прогноз. Именно поэтому компании с большими объемами данных — Google, Яндекс, Amazon — первыми начали масштабно применять эту технологию.

Термин «machine learning» ввел Артур Сэмюэл в 1959 году, когда создавал программу для игры в шашки, которая улучшалась по мере партий. Настоящий прорыв произошел в 2012 году: нейронная сеть AlexNet выиграла конкурс ImageNet с точностью распознавания изображений 84,7%, тогда как предыдущий рекорд составлял 74,3%. В 2016 году система AlphaGo от DeepMind победила чемпиона мира по го Ли Седоля — игре, которая считалась недоступной для машин из-за астрономического числа возможных комбинаций. С 2015 по 2022 год объем мирового рынка МО вырос с 1,03 до 19,2 млрд долларов, по данным Grand View Research. Сегодня алгоритмы МО работают за кулисами большинства цифровых продуктов: от рекомендаций на Netflix до фильтрации спама в Gmail. Эволюция шла стремительно: от игрушечных задач 1950-х до технологии, управляющей триллионными рекламными рынками.

В digital-маркетинге машинное обучение сместило парадигму с «настрой один раз» на «оптимизируй постоянно». Алгоритмы Google Smart Bidding каждые несколько секунд пересчитывают ставки на аукционе, учитывая десятки сигналов: тип устройства, время суток, геолокацию, историю поиска. По данным Google, рекламодатели, перешедшие на автоматические стратегии на основе МО, в среднем получают на 20% больше конверсий при том же бюджете. Яндекс.Директ использует МО для автотаргетинга — система сама определяет, каким запросам соответствует объявление, даже если рекламодатель эти запросы не указал. В e-mail маркетинге алгоритмы предсказывают оптимальное время отправки для каждого пользователя: Mailchimp сообщает, что функция Send Time Optimization повышает открываемость писем в среднем на 23%. МО лежит в основе систем персонализации контента, предиктивной аналитики оттока клиентов, чат-ботов и автоматической генерации рекламных текстов. Без понимания этих механизмов маркетолог работает вслепую.

Маркетолог, который не понимает принципов МО, рискует принимать решения, противоречащие логике алгоритмов. Например, частое вмешательство в работу автоматических стратегий Google Ads — снижение ставок или смена бюджета каждые два дня — сбрасывает «обучение» кампании и возвращает ее к стартовому уровню. По данным Salesforce (State of Marketing, 2023), 71% высокоэффективных маркетинговых команд уже используют МО в своей работе против 32% среди команд со средними результатами. Бизнес, внедряющий МО, получает конкурентное преимущество, которое сложно скопировать: алгоритм накапливает специфические для ваших данных закономерности и становится точнее со временем. Компании, использующие предиктивную аналитику на базе МО, удерживают клиентов в среднем на 15% эффективнее, согласно исследованию McKinsey. Понимание МО позволяет правильно ставить задачи подрядчикам, выбирать инструменты и интерпретировать результаты, а не слепо доверять «черному ящику».

Как работает машинное обучение

  1. Сбор и подготовка данных. Процесс начинается не с кода, а с данных. Для обучения модели прогноза оттока клиентов нужна история покупок, частота обращений в поддержку, активность в приложении — минимум за 12-24 месяца. Данные очищаются от дубликатов, пропущенных значений и аномалий: например, транзакция на 1 500 000 рублей в магазине с средним чеком 3 000 — скорее ошибка, а не реальная покупка, и ее исключают. Качество данных критично: «мусор на входе — мусор на выходе» — базовый принцип ML-инженерии, и на этом этапе опытные специалисты тратят до 60-70% рабочего времени.
  2. Выбор и разработка признаков (Feature Engineering). Из сырых данных формируются признаки, которые алгоритм будет анализировать. Из даты рождения клиента вычисляется возраст; из даты последней покупки — «давность» обращения (recency); из суммы всех покупок за год — ценность клиента (LTV). Правильный набор признаков часто важнее выбора самого алгоритма: на практике ML-инженер тратит 80% времени именно на этот шаг. Плохо подобранные признаки делают даже самую мощную архитектуру бесполезной.
  3. Выбор модели и архитектуры. Разные задачи требуют разных алгоритмов. Для классификации (спам/не спам) подходит логистическая регрессия или Random Forest; для прогноза числовых значений (выручка следующего месяца) — градиентный бустинг или нейронная сеть; для кластеризации клиентов без заранее известных категорий — K-means или DBSCAN. Выбор не финальный: обычно тестируются 3-5 алгоритмов и выбирается лучший по метрикам качества на валидационной выборке.
  4. Обучение и оптимизация. Алгоритм итеративно проходит по обучающей выборке (обычно 70-80% всех данных), делает предсказания и корректирует внутренние параметры, минимизируя ошибку. Градиентный спуск — основной механизм оптимизации: алгоритм движется в направлении, где ошибка убывает быстрее всего, шаг за шагом приближаясь к минимуму функции потерь. Для сложных нейронных сетей этот процесс может занимать дни или недели на специализированных GPU-серверах.
  5. Валидация и тестирование. Обученная модель проверяется на тестовой выборке, которую она «не видела» во время обучения, — это позволяет оценить реальную обобщающую способность. Ключевые метрики: точность (accuracy), полнота (recall), F1-score для классификации; MAE, RMSE для регрессионных задач. Особое внимание уделяется переобучению (overfitting) — когда модель отлично предсказывает на обучающих данных, но плохо справляется с новыми примерами.
  6. Деплой и мониторинг в production. Готовая модель интегрируется в продукт через API или встраивается в систему напрямую. Но работа не заканчивается: данные меняются со временем, и модель деградирует — это называется «дрейф данных» (data drift). Поэтому в production настраивается мониторинг ключевых метрик и периодическое переобучение: в e-commerce модели рекомендаций переобучаются еженедельно или ежедневно, чтобы учитывать актуальные тренды и новые товары.

Виды машинного обучения

  • Обучение с учителем (Supervised Learning). Алгоритм обучается на размеченных данных, где каждому примеру соответствует правильный ответ. Например, 10 000 писем, уже помеченных как «спам» или «не спам», — обучающая выборка для спам-фильтра. Применяется для прогноза оттока клиентов, классификации обращений в поддержку, оценки кредитного риска, прогноза выручки. По данным Gartner, это наиболее широко применяемый тип МО в бизнесе — встречается в 60% корпоративных проектов по машинному обучению.
  • Обучение без учителя (Unsupervised Learning). Алгоритм самостоятельно находит паттерны в данных без заранее известных правильных ответов. Кластеризация клиентов по поведению — типичный пример: алгоритм K-means делит аудиторию на группы по сходству признаков, не зная заранее, сколько групп нужно найти. Полезен для сегментации клиентской базы, обнаружения аномалий в транзакциях, сжатия данных и тематического моделирования текстов — везде, где нет заранее известной разметки.
  • Обучение с подкреплением (Reinforcement Learning). Агент обучается через взаимодействие со средой: совершает действия, получает вознаграждение или штраф и постепенно улучшает стратегию. AlphaGo работает именно так. В маркетинге RL применяется в системах динамического ценообразования (алгоритм Uber Surge Pricing) и оптимизации размещения рекламы в real-time bidding. Технология сложная в реализации, но дает результаты там, где правила невозможно задать явно.
  • Глубокое обучение (Deep Learning). Подтип МО, использующий многослойные нейронные сети, способные обрабатывать неструктурированные данные: изображения, звук, текст. Модели с миллиардами параметров (GPT-4, Gemini) обучаются на терабайтах текста и способны генерировать связные ответы. В маркетинге глубокое обучение лежит в основе компьютерного зрения (автоматическая разметка фото товаров), NLP (анализ тональности отзывов) и генерации рекламных изображений.
  • Трансфертное обучение (Transfer Learning). Модель, обученная на одной задаче, дообучается на другой с минимальным количеством примеров. BERT, предобученный на 3,3 млрд словах, после дообучения всего на 1000 примерах отзывов достигает точности классификации тональности 92%. Для бизнеса это означает: не нужно собирать огромные датасеты с нуля — достаточно взять предобученную модель и адаптировать ее под свою задачу за одну-две недели.
  • Обучение с частичной разметкой (Semi-Supervised Learning). Компромиссный подход: небольшая часть данных размечена вручную (что дорого), большая — нет. Алгоритм обучается на размеченных примерах и переносит знания на неразмеченные. Актуален для задач, где разметка стоит дорого: медицинские снимки, анализ юридических документов, транскрипция переговоров с клиентами. Позволяет сократить затраты на разметку в 5-10 раз при незначительной потере точности.

Сравнение машинного обучения и традиционного программирования

Параметр Машинное обучение Традиционное программирование
Источник логики Закономерности, найденные в данных автоматически Правила, написанные разработчиком вручную
Адаптация к изменениям Автоматическая при переобучении на новых данных Требует ручного обновления правил разработчиком
Прозрачность решений Низкая — «черный ящик», решение сложно объяснить Высокая — каждое правило читаемо и проверяемо
Требования к данным Нужны большие объемы качественных размеченных данных Данные не обязательны для написания логики
Лучшее применение Сложные паттерны: рекомендации, NLP, распознавание образов Четкие бизнес-правила: расчет скидок, валидация форм
Стоимость поддержки Регулярное переобучение, мониторинг дрейфа данных Обновление при изменении бизнес-логики

Пример использования

Сервис подписки на онлайн-курсы (EdTech) с 250 000 активных пользователей фиксировал ежемесячный отток 8,2% — около 20 500 человек не продлевали подписку каждый месяц. Команда отправляла одинаковые реактивационные письма всей базе: CTR составлял 3,1%, выручка от удержания — 1,2 млн рублей в месяц. Проблема была не в тексте писем, а в том, что компания не знала, кто именно собирается уйти и когда.

Команда внедрила модель предсказания оттока на основе градиентного бустинга (XGBoost). Модель анализировала 47 признаков: частоту входов за последние 30 дней, долю завершенных уроков, активность в форуме, количество дней с последнего входа. За 6 недель подготовили датасет (18 месяцев истории), обучили модель с AUC-ROC 0,87. Систему интегрировали с CRM: пользователи с вероятностью оттока выше 70% автоматически получали персонализированное предложение — скидку 30% или доступ к «закрытому» курсу. Через 90 дней отток снизился до 5,9% (-28%), CTR реактивационных писем вырос до 11,4% (в 3,7 раза), выручка от удержания выросла до 2,1 млн рублей в месяц (+75%). Скидки получали только реально «уходящие» пользователи — экономия на промо-бюджете составила около 340 000 рублей в месяц по сравнению с ковровыми рассылками.

Частые вопросы

Сколько данных нужно для обучения модели, чтобы она работала точно?

Конкретных цифр нет — все зависит от задачи и алгоритма. Для классических методов (логистическая регрессия, Random Forest) на задачах классификации обычно достаточно 1000-5000 примеров на класс, чтобы получить рабочую модель. Для глубокого обучения без трансфертного подхода — десятки тысяч примеров минимум. Правило большого пальца: если нужно классифицировать обращения в поддержку по 10 категориям, нужно минимум 500-1000 размеченных примеров каждой категории. Если данных меньше — начинайте с трансфертного обучения на предобученных моделях (BERT для текстов, ResNet для изображений). На практике для большинства бизнес-задач (прогноз оттока, скоринг лидов, рекомендации) достаточно 6-12 месяцев истории операций, если бизнес обрабатывает хотя бы несколько тысяч транзакций в месяц.

Можно ли внедрить машинное обучение в малом бизнесе без команды data scientists?

Можно, и сегодня это доступнее, чем когда-либо. Облачные сервисы — Google AutoML, Яндекс DataSphere, Azure Machine Learning — позволяют обучить модель без написания кода: загружаете CSV с данными, выбираете целевую метрику, сервис сам подбирает алгоритм. Стоимость старта — от 0 рублей (Google Colab c бесплатными квотами AutoML) до нескольких тысяч рублей в месяц за облачные вычисления. Для e-commerce готовые ML-решения встроены в большинство платформ: Retail Rocket, Mindbox, Mindbox уже содержат алгоритмы рекомендаций и предсказания оттока «из коробки». Реальный барьер для малого бизнеса — не технология, а данные: если в базе меньше 2000-3000 клиентов или история короче 6 месяцев, МО не даст значимого преимущества перед простыми правилами. Начинайте с инструментов, где МО уже встроено: умные кампании в Яндекс.Директ, автоматические стратегии в Google Ads, предиктивная сегментация в Mailchimp — это МО без единой строки кода.

Чем машинное обучение отличается от обычной автоматизации на основе правил?

Ключевое отличие — в источнике правил и способности к адаптации. Правила в классической автоматизации пишет человек: «если пользователь не заходил 7 дней — отправить напоминание». Машинное обучение само извлекает правила из данных: алгоритм обнаруживает, что для пользователей сегмента B2B отсутствие входа 14 дней — норма, а для B2C критично уже на третий день. Правила-фильтры не масштабируются: спам-фильтр на правилах может поддерживать 50-100 условий, после чего становится неуправляемым. ML-фильтр Gmail анализирует тысячи признаков письма одновременно — по данным Google, нейронные сети снизили количество спама, попадающего во входящие, до менее 0,1%. Правила нужны там, где логика четкая и не меняется (валидация телефона, расчет НДС). МО выигрывает там, где правила слишком сложны, противоречивы или постоянно меняются вместе с данными — как поведение аудитории в маркетинге.

Все термины