Зображення статті
## Чому вибір архітектури детекції має значення для виробничого CV
Комп'ютерний зір у промисловості — це не хайп, це вже зрілий ринок із чіткими вимогами: швидкість inference, точність виявлення дефектів, стійкість до умов освітлення, можливість роботи на edge-пристроях. Три сімейства архітектур — YOLO, EfficientDet та Vision Transformers (ViT) — по-різному відповідають на ці вимоги.
Правильний вибір між ними може визначити, чи впорається система з ритмом конвеєра 200 деталей за хвилину, чи виявить дефект розміром 0,3 мм, чи запрацює на промисловому комп'ютері без виділеної GPU. Нижче — детальне технічне порівняння на основі реальних промислових датасетів і практичних сценаріїв.
## YOLO: швидкість як ключова перевага
YOLO (You Only Look Once) — сімейство архітектур, спроектованих для максимально швидкого inference. Назва описує ключову ідею: одне проходження зображення через мережу дає всі детекції одночасно, без окремих фаз region proposal і класифікації.
### Еволюція версій для промислових задач
**YOLOv5** залишається популярним вибором завдяки зрілій екосистемі та документації. Підтримує ONNX, TensorRT та CoreML для edge deployment. На Jetson Xavier NX досягає 120–140 FPS для зображень 640×640, що достатньо для більшості конвеєрів.
**YOLOv8** від Ultralytics — значний крок вперед. Оновлений backbone (C2f замість C3), anchor-free детектор, краща точність при схожій швидкості. Єдина кодова база для детекції, сегментації та класифікації спрощує розробку.
**YOLOv10 та YOLOv11** — найновіші версії з подальшою оптимізацією efficiency. YOLOv10 запровадив NMS-free training, що знижує latency inference на 20–30%.
### Реальні бенчмарки на промислових датасетах
На датасеті MVTec AD (промисловий стандарт для контролю якості, 15 категорій дефектів):
- YOLOv8s: mAP@0.5 = 0.76, inference 4 мс на NVIDIA T4
- YOLOv8m: mAP@0.5 = 0.81, inference 7 мс на NVIDIA T4
- YOLOv8l: mAP@0.5 = 0.84, inference 12 мс на NVIDIA T4
На CPU (Intel i7-12700K) YOLOv8s дає 45 мс inference — прийнятно для неспішних ліній, але недостатньо для високошвидкісних конвеєрів.
### Сильні сторони YOLO для промислового CV
- **Реальний час на edge.** YOLOv8n на Jetson Nano дає 30+ FPS при потужності 5–10 Вт
- **Проста інтеграція.** API Ultralytics дозволяє запустити перший прототип за десятки рядків коду
- **Широка екосистема.** TensorRT, OpenVINO, ONNX — готові шляхи оптимізації для промислових платформ
- **Добрі pretrained моделі** на загальних датасетах, які швидко fine-tune на специфічних дефектах
### Обмеження YOLO
- Детекція дрібних дефектів (менше 16×16 пікселів на зображенні 640×640) залишається викликом, особливо при перекриттях
- Нижча точність на складних поверхневих дефектах порівняно з EfficientDet-D5/D7
## EfficientDet: баланс між точністю та ефективністю
EfficientDet, розроблений Google Brain, реалізує іншу філософію: максимальна точність при обмежених обчислювальних ресурсах. Ключові архітектурні рішення — EfficientNet backbone і BiFPN (Bidirectional Feature Pyramid Network).
### BiFPN і multi-scale fusion
Класична Feature Pyramid Network (FPN) об'єднує ознаки різних масштабів лише у низхідному напрямку. BiFPN додає висхідні зв'язки і навчувані ваги для кожного вхідного вузла, що значно покращує виявлення об'єктів різних розмірів — критично для промислових дефектів, де тріщина може бути і мікроскопічною, і великою.
### Compound scaling
EfficientDet масштабується через одночасне збільшення глибини мережі, ширини та роздільності вхідного зображення за фіксованим коефіцієнтом. Це дає сімейство моделей D0–D7 з передбачуваним trade-off між ресурсами та точністю.
На MVTec AD:
- EfficientDet-D2: mAP@0.5 = 0.80, inference 18 мс на T4
- EfficientDet-D4: mAP@0.5 = 0.86, inference 40 мс на T4
- EfficientDet-D7: mAP@0.5 = 0.91, inference 130 мс на T4
EfficientDet-D7 перевершує YOLOv8l за точністю, але ціна — у 10 разів більша latency.
### Коли EfficientDet є кращим вибором
- Задачі з малими дефектами: мікротріщини, порошина, точкова корозія (BiFPN дає перевагу)
- Batch-обробка: аналіз зображень не в реальному часі (нічна перевірка партії)
- Задачі, де хибно пропущений дефект коштує набагато дорожче, ніж затримка inference
## Vision Transformers: нова парадигма
Vision Transformers (ViT) — архітектура, що запозичила механізм self-attention з NLP і застосувала до зображень. Зображення ділиться на патчі (наприклад, 16×16 пікселів), кожен патч перетворюється у вектор, і transformer обробляє послідовність цих векторів.
### Що дає self-attention для промислового CV
Self-attention дозволяє кожному патчу «дивитись» на весь інший контекст зображення одночасно. Це корисно для задач, де дефект проявляється лише у контексті сусідніх структур: наприклад, нерівномірність покриття видна лише при порівнянні сусідніх ділянок.
### Практичний стан ViT для промислових застосувань (2024–2025)
ViT та його похідні (DeiT, Swin Transformer, DINO) показують strong performance на ImageNet і спеціалізованих завданнях, але у промисловому production мають обмеження:
- **Висока обчислювальна вимогливість.** Swin-T fast inference — 50–80 мс на T4 GPU. Для edge недоступні без серйозної квантизації
- **Повільне fine-tuning.** ViT-моделі потребують більших датасетів і більшого часу навчання порівняно з CNN-архітектурами
- **Менша зрілість екосистеми.** Менше готових рішень для TensorRT-оптимізації, менше документації по промисловим кейсам
**RT-DETR** (Real-Time Detection Transformer від Baidu) — найбільш перспективна ViT-похідна для промислового застосування. На COCO dataset порівнянна з YOLOv8l за швидкістю при кращій точності. Активно розвивається і може змінити баланс протягом 2025–2026 років.
## Практична матриця вибору
Для прийняття рішення дайте відповідь на чотири запитання.
### Запитання 1: Яка вимога до latency?
| Вимога | Рекомендація |
|--------|-------------|
| До 20 мс (600+ FPS теоретично) | YOLOv8n або YOLOv8s |
| 20–50 мс | YOLOv8m або EfficientDet-D2 |
| 50–150 мс | EfficientDet-D4 або YOLOv8l |
| Без жорстких вимог | EfficientDet-D7 або ViT |
### Запитання 2: Де виконується inference?
- **Jetson Nano / Xavier / Orin:** YOLOv8n–m з TensorRT. EfficientDet-D0 максимум
- **Промисловий ПК з GPU (RTX 3060 і вище):** будь-яка архітектура
- **CPU-only середовище:** YOLOv8n або OpenVINO-оптимізована модель
- **Хмара з GPU:** EfficientDet-D5/D7 або RT-DETR
### Запитання 3: Які розміри дефектів?
- **Великі дефекти (понад 5% площі зображення):** YOLO — достатня точність при максимальній швидкості
- **Середні дефекти (1–5%):** YOLOv8l або EfficientDet-D3/D4
- **Дрібні дефекти (менше 1%):** EfficientDet-D5+ з вхідною роздільністю 1280×1280 або tile-inference для YOLO
### Запитання 4: Яка критичність пропущеного дефекту?
- **Висока (авіація, медицина, безпека):** EfficientDet-D7 + ансамблі + людський review
- **Середня (автомобілебудування, електроніка):** YOLOv8l або EfficientDet-D4 з оптимізованим порогом confidence
- **Низька (прототип, демонстрація):** YOLOv8s
## Апаратна інфраструктура: порівняльні витрати
Вибір архітектури нерозривно пов'язаний з апаратними витратами.
**NVIDIA Jetson Orin NX** (від $499): підтримує YOLOv8m при 60+ FPS. Промисловий рівень надійності, IP-захист, -25°C до +80°C. Оптимальний для нових проєктів.
**NVIDIA Jetson Xavier NX** (від $399): YOLOv8s при 120+ FPS або YOLOv8m при 60 FPS. Перевірений у тисячах промислових деплоїв.
**Intel NUC з OpenVINO**: CPU-inference YOLOv8n при 20–30 FPS. Простіша інтеграція у Windows-середовища, але нижча продуктивність.
**Хмарний GPU (AWS, GCP)**: для batch-обробки або задач без жорстких вимог до latency. EfficientDet-D7 на p3.xlarge (V100) — 8–10 FPS batch inference.
## Висновок: немає одного правильного вибору
YOLO v8/v10/v11 — оптимальний вибір для 70% промислових задач завдяки поєднанню швидкості, зрілої екосистеми та простоти розгортання. Починайте з YOLOv8m і тестуйте на власних даних.
EfficientDet-D3/D4 — коли точність критичніша за latency і є бюджет на потужніше GPU-обладнання.
ViT / RT-DETR — для нових проєктів, де є GPU-ресурси і завдання складне. Очікуйте зростання ролі цих архітектур у наступні 1–2 роки.
Головне правило: **тестуйте на власних реальних даних**. Різниця між публічним бенчмарком і вашим специфічним типом дефектів може бути суттєвою в обидва боки. Збір 500–1 000 зображень дефектів і порівняльний тест — єдиний надійний спосіб прийняти правильне рішення.
Стаття в розробці. Підпишіться щоб отримати сповіщення.
Написати нам →#комп'ютерний зір#YOLO#виробництво#контроль якості#edge AI
ІП
Іван Полтавець
Команда CodeNest
Практикуючий ML-інженер. Спеціалізується на побудові виробничих AI-систем для бізнесу.
🤖
Готові автоматизувати ваш бізнес?
Обговоримо ваш проєкт і запропонуємо оптимальне рішення. Безкоштовна консультація без зобов'язань.