Перейти до змісту
Технічний блог

Feature engineering в 2025: що залишилось важливим після нейронних мереж

27 травня 2025 р.·11 хв читання·Іван Полтавець
Зображення статті
## Похоронний дзвін, якого не було У 2015-2018 роках ентузіасти глибокого навчання активно декларували: нейронні мережі навчаться самостійно витягувати будь-які ознаки з сирих даних, і ручний feature engineering відійде в минуле. Реальність 2025 року виявилась набагато нюансованішою. Нейронні мережі дійсно автоматизували feature learning у певних доменах: комп'ютерний зір і обробка природної мови тепер вирішуються кінець-в-кінець без ручних ознак. Але для структурованих табличних даних — яких в бізнесі незрівнянно більше — feature engineering залишається одним з найважливіших інструментів data scientist. ## Де нейронні мережі дійсно замінили feature engineering Для зображень, аудіо і тексту — впевнена перемога нейронних мереж. BERT не потребує ручної токенізації зі збереженням контексту. ResNet витягує ієрархію ознак з пікселів без вказівки людини. Wav2Vec розуміє мову без інженерії спектральних ознак. У цих доменах ручний feature engineering не лише непотрібний — він активно шкідливий: введення ручних ознак обмежує те, що модель може знайти самостійно. ## Де feature engineering залишається незамінним ### Структуровані табличні дані Для класичних задач — прогнозування відтоку, кредитний скоринг, прогноз попиту, fraud detection — XGBoost і LightGBM з якісними ознаками стабільно перевершують або збігаються з глибокими мережами. І ця перевага забезпечується саме feature engineering. Чому? Табличні дані рідко і маленькі (тисячі-сотні тисяч рядків проти мільйонів зображень), і у глибоких мереж просто недостатньо даних для автоматичного feature learning. Крім того, доменна експертиза дозволяє конструювати ознаки, що кодують складні бізнес-правила, які нейромережа навчиться лише на величезному датасеті. ### Часові ряди Прогнозування попиту, фінансові ряди, IoT-сигнали сенсорів — тут feature engineering залишається ключовим навіть у 2025 році. Лаговані ознаки, ковзні середні, декомпозиція на тренд/сезонність/залишок, calendar features (день тижня, свято, місяць) дають моделі необхідний контекст. Популярні бібліотеки: tsfresh (автоматична генерація 779+ ознак з часових рядів), featuretools (deep feature synthesis для реляційних даних). Але навіть з автоматичною генерацією доменна інтуїція щодо того, які часові патерни важливі, визначає якість. ### Малі датасети При обмеженій кількості даних (сотні або тисячі прикладів) feature engineering є критичним способом «вкласти» доменне знання в модель. Fine-tuning BERT потребує мінімум 500-1 000 прикладів. LightGBM на 200 правильно сконструйованих ознаках може показати прийнятний результат вже при 200-500 прикладах. ## Ключові техніки, що залишаються актуальними ### Interaction features Нейронні мережі теоретично вчаться взаємодіям між ознаками автоматично, але на малих табличних датасетах не завжди встигають. Явне конструювання добутків, відношень і різниць ознак часто дає відчутний приріст. Приклад для кредитного скорингу: дохід / витрати = coverage ratio. Відокремлено дохід і витрати менш інформативні, ніж їх відношення. ### Temporal features для бізнес-задач «Кількість днів від останньої покупки» — корисна ознака. Але «кількість днів від останньої покупки відносно середнього для когорти клієнтів з аналогічним профілем» — значно потужніша. Відносні ознаки, що враховують контекст, майже завжди перевершують абсолютні. ### Target encoding з контролем витоку Target encoding (заміна категорії на середнє значення цільової змінної) — одна з найефективніших технік для категоріальних ознак з великою кількістю значень. Але наївна реалізація призводить до data leakage. Правильний підхід: out-of-fold encoding з кросвалідацією. ### Автоматизовані підходи: AutoML і feature stores AutoML платформи (H2O AutoML, TPOT, AutoSklearn) поєднують автоматичний feature engineering і вибір моделі. Для стандартних задач вони можуть дати 80-90% від того, що дасть досвідчений data scientist за тиждень ручної роботи — за годину. Feature stores (Feast, Hopsworks) централізують ознаки між різними ML-моделями організації, виключаючи дублювання обчислень і гарантуючи консистентність між навчанням і inference. ## Практична рамка для прийняття рішень у 2025 Питання не «робити чи не робити feature engineering», а «скільки і якого виду». Для зображень, аудіо, тексту: мінімальний preprocessing (нормалізація, токенізація), решта — нейронній мережі. Для табличних даних з багатою доменною експертизою: інвестуйте в feature engineering активно. Правильно сконструйовані ознаки часто дають 5-15% приросту метрик порівняно з сирими даними. Для часових рядів: обов'язковий набір calendar features, лагових ознак і rolling statistics. Далі — за потребою. Для малих датасетів (менше 5 000 прикладів): feature engineering критичний незалежно від типу даних. Hybrid підхід: навчена нейромережа як feature extractor + XGBoost або LightGBM на вилучених ознаках. Часто перевершує обидва підходи окремо на середніх датасетах. Передчасна відмова від feature engineering заради «чистого deep learning» без урахування розміру датасету і доменної специфіки — одна з найпоширеніших помилок, що призводить до гірших production-результатів.

Стаття в розробці. Підпишіться щоб отримати сповіщення.

Написати нам →
#ML стратегія#feature engineering#data science
Поділитись:
ІП

Іван Полтавець

Команда CodeNest

Практикуючий ML-інженер. Спеціалізується на побудові виробничих AI-систем для бізнесу.

🤖

Готові автоматизувати ваш бізнес?

Обговоримо ваш проєкт і запропонуємо оптимальне рішення. Безкоштовна консультація без зобов'язань.

Схожі статті

Впровадити ML у вашому бізнесі?

Від безкоштовної консультації до production-рішення. Обговоримо вашу задачу.