ИССЛЕДОВАНИЕ СТРАТЕГИЙ СЕЛЕКТИВНОЙ АУГМЕНТАЦИИ ДЛЯ СЕМАНТИЧЕСКОЙ СЕГМЕНТАЦИИ АЭРОФОТОСНИМКОВ БПЛА
DOI:
https://doi.org/10.5281/zenodo.20800042Ключевые слова:
семантическая сегментация, StripNet, FPN, SynDrone, БПЛА, аэрофотосъёмка, селективная аугментация, RareClassToGrayAugMask, Copy-PasteПоддерживающие организации
Лицензия
Аннотация
Семантическая сегментация аэрофотоснимков полученных с помощью беспилотных летательных аппаратов (БПЛА) применяется для мониторинга городской инфраструктуры. При обучении дисбаланс классов остаётся нерешённой проблемой: объекты инфраструктуры малого размера занимают менее двух процентов пикселей сцены, что приводит к недостаточной точности сегментации на этих категориях. Существующие методы расширения данных довольно эффективно позволяют бороться с проблемой. Метод RareClassToGrayAugMask, предложенный в настоящей статье, выполняет селективное обесцвечивание пикселей только в областях масок заданных семантических классов, а также искажает область обесцвечивания, что повышает робастность, инвариантность модели к цвету в областях редких объектов.
Скачивания
Библиографические ссылки
1. Encoder-Decoder with Atrous Separable Convolution for Semantic Image Segmentation / L.-C. Chen, Y. Zhu, G. Papandreou [et al.] // Lecture Notes in Computer Science. – 2018. – Vol. 11211. – P. 801-818.
2. Зуев, В. М. Сравнение обнаружения объектов средствами искусственного интеллекта в сравнении с классическими методами / В. М. Зуев // Проблемы искусственного интеллекта. – 2024. – Т. 34, № 3. – С. 4-10.
3. SynDrone – Multi-modal UAV Dataset for Urban Scenarios / G. Rizzoli, F. Barbato, M. Caligiuri [et al.] // Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV). – 2023. – P. 2236-2246.
4. Пикалёв, Я. С. Обнаружение ключевых объектов и перекрёстная геолокализация: анализ наборов данных и методологические перспективы / Я. С. Пикалёв // Проблемы искусственного интеллекта. – 2024. – № 4 (35). – С. 25-37. – DOI 10.24412/2413-7383-2024-4-25-37.
5. Устенко, В. Ю. Методика расширения данных для сегментации ключевых объектов на аэрофотоснимках БПЛА / В. Ю. Устенко, М. В. Близно // Проблемы искусственного интеллекта. – 2025. – № 4 (39). – С. 84-97. – DOI 10.24412/2413-7383-2025-4-39-84-97.
6. Image Segmentation Using Deep Learning: A Survey / S. Minaee, Y. Boykov, F. Porikli [et al.] // IEEE Transactions on Pattern Analysis and Machine Intelligence. – 2022. – Vol. 44, no. 7. – P. 3523-3542.
7. Shorten, C. A Survey on Image Data Augmentation for Deep Learning / C. Shorten, T. M. Khoshgoftaar // Journal of Big Data. – 2019. – Vol. 6, No. 1. – Art. 60.
8. DeVries, T. Improved Regularization of Convolutional Neural Networks with Cutout / T. DeVries, G. W. Taylor // arXiv preprint. – 2017. – URL: https://arxiv.org/abs/1708.04552.
9. Masked Autoencoders Are Scalable Vision Learners / K. He, X. Chen, S. Xie [et al.] // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). – 2022. – P. 16000-16009.
10. Choi, J. Colorful Cutout: Enhancing Image Data Augmentation with Curriculum Learning / J. Choi, Y. Kim // arXiv preprint. – 2024. – URL: https://arxiv.org/pdf/2403.20012.
11. Mixup: Beyond empirical risk minimization/ H. Zhang, M. Cisse, Y. N. Dauphin [et al.] // arXiv preprint. – 2017. – URL: https://arxiv.org/abs/1710.09412.
12. CutMix: Regularization Strategy to Train Strong Classifiers with Localizable Features / S. Yun, D. Han, S. Chun [et al.] // Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV). – 2019. – P. 6023-6032.
13. Simple Copy-Paste is a Strong Data Augmentation Method for Instance Segmentation / G. Ghiasi, Y. Cui, A. Srinivas [et al.] // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). – 2021. – P. 2917-2928.
14. ImageNet-trained CNNs are biased towards textures; increasing shape bias improves accuracy and robustness / R. Geirhos, P. Rubisch, C. Michaelis [et al.] // Proceedings of the International Conference on Learning Representations (ICLR). – 2019. – 22 p.
15. Lee, J. Improving Robustness to Texture Bias via Shape-Focused Augmentation / J. Lee, S. Kim, S. Kim [et al.] // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW). – 2022. – P. 4323-4331
16. Deep Long-Tailed Learning: A Survey / Y. Zhang, B. Kang, B. Hooi [et al.] // IEEE Transactions on Pattern Analysis and Machine Intelligence. – 2023. – Vol. 45, No. 9. – P. 10795-10816.
17. CP2M: Clustered-Patch-Mixed Mosaic Augmentation for Aerial Image Segmentation / Y. Li [et al.] // arXiv preprint. – 2025. – URL: https://arxiv.org/pdf/2501.15389.
18. UAVid: A Semantic Segmentation Dataset for UAV Imagery / Y. Lyu, G. Vosselman, G.-S. Xia [et al.] // ISPRS Journal of Photogrammetry and Remote Sensing. – 2020. – Vol. 165. – P. 108-119. – DOI 10.1016/j.isprsjprs.2020.05.009.
19. Pyramid Scene Parsing Network / H. Zhao, J. Shi, X. Qi [et al.] // Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR). – 2017. – P. 6230-6239.
20. The Pascal Visual Object Classes (VOC) Challenge / M. Everingham, L. Van Gool, C. K. I. Williams [et al.] // International Journal of Computer Vision. – 2010. – Vol. 88, No. 2. – P. 303-338.
21. Hermann, K. L. The Origins and Prevalence of Texture Bias in Convolutional Neural Networks / K. L. Hermann, T. Chen, S. Kornblith // Advances in Neural Information Processing Systems (NeurIPS). – 2020. – Vol. 33. – P. 19000-19015.
22. Feature Pyramid Networks for Object Detection / T.-Y. Lin, P. Dollar, R. Girshick [et al.] // Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR). – 2017. – P. 936-944.
REFERENCES LIST
1. Encoder-Decoder with Atrous Separable Convolution for Semantic Image Segmentation / L.-C. Chen, Y. Zhu, G. Papandreou [et al.] // Lecture Notes in Computer Science. – 2018. – Vol. 11211. – P. 801-818.
2. Zuev, V. M. Sravnenie obnaruzheniia obieektov sredstvami iskusstvennogo intellekta v sravnenii s klassicheskimi metodami / V. M. Zuev // Problemy iskusstvennogo intellekta. – 2024. – T. 34, № 3. – S. 4-10.
3. SynDrone – Multi-modal UAV Dataset for Urban Scenarios / G. Rizzoli, F. Barbato, M. Caligiuri [et al.] // Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV). – 2023. – P. 2236-2246.
4. Pikalev, Ia. S. Obnaruzhenie kliuchevykh obieektov i perekrestnaia geolokalizatsiia: analiz naborov dannykh i metodologicheskie perspektivy / Ia. S. Pikalev // Problemy iskusstvennogo intellekta. – 2024. – № 4 (35). – S. 25-37. – DOI 10.24412/2413-7383-2024-4-25-37.
5. Ustenko, V. Iu. Metodika rasshireniia dannykh dlia segmentatsii kliuchevykh obieektov na aerofotosnimkakh BPLA / V. Iu. Ustenko, M. V. Blizno // Problemy iskusstvennogo intellekta. – 2025. – № 4 (39). – S. 84-97. – DOI 10.24412/2413-7383-2025-4-39-84-97.
6. Image Segmentation Using Deep Learning: A Survey / S. Minaee, Y. Boykov, F. Porikli [et al.] // IEEE Transactions on Pattern Analysis and Machine Intelligence. – 2022. – Vol. 44, no. 7. – P. 3523-3542.
7. Shorten, C. A Survey on Image Data Augmentation for Deep Learning / C. Shorten, T. M. Khoshgoftaar // Journal of Big Data. – 2019. – Vol. 6, No. 1. – Art. 60.
8. DeVries, T. Improved Regularization of Convolutional Neural Networks with Cutout / T. DeVries, G. W. Taylor // arXiv preprint. – 2017. – URL: https://arxiv.org/abs/1708.04552.
9. Masked Autoencoders Are Scalable Vision Learners / K. He, X. Chen, S. Xie [et al.] // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). – 2022. – P. 16000-16009.
10. Choi, J. Colorful Cutout: Enhancing Image Data Augmentation with Curriculum Learning / J. Choi, Y. Kim // arXiv preprint. – 2024. – URL: https://arxiv.org/pdf/2403.20012.
11. Mixup: Beyond empirical risk minimization/ H. Zhang, M. Cisse, Y. N. Dauphin [et al.] // arXiv preprint. – 2017. – URL: https://arxiv.org/abs/1710.09412.
12. CutMix: Regularization Strategy to Train Strong Classifiers with Localizable Features / S. Yun, D. Han, S. Chun [et al.] // Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV). – 2019. – P. 6023-6032.
13. Simple Copy-Paste is a Strong Data Augmentation Method for Instance Segmentation / G. Ghiasi, Y. Cui, A. Srinivas [et al.] // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). – 2021. – P. 2917-2928.
14. ImageNet-trained CNNs are biased towards textures; increasing shape bias improves accuracy and robustness / R. Geirhos, P. Rubisch, C. Michaelis [et al.] // Proceedings of the International Conference on Learning Representations (ICLR). – 2019. – 22 p.
15. Lee, J. Improving Robustness to Texture Bias via Shape-Focused Augmentation / J. Lee, S. Kim, S. Kim [et al.] // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW). – 2022. – P. 4323-4331
16. Deep Long-Tailed Learning: A Survey / Y. Zhang, B. Kang, B. Hooi [et al.] // IEEE Transactions on Pattern Analysis and Machine Intelligence. – 2023. – Vol. 45, No. 9. – P. 10795-10816.
17. CP2M: Clustered-Patch-Mixed Mosaic Augmentation for Aerial Image Segmentation / Y. Li [et al.] // arXiv preprint. – 2025. – URL: https://arxiv.org/pdf/2501.15389.
18. UAVid: A Semantic Segmentation Dataset for UAV Imagery / Y. Lyu, G. Vosselman, G.-S. Xia [et al.] // ISPRS Journal of Photogrammetry and Remote Sensing. – 2020. – Vol. 165. – P. 108-119. – DOI 10.1016/j.isprsjprs.2020.05.009.
19. Pyramid Scene Parsing Network / H. Zhao, J. Shi, X. Qi [et al.] // Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR). – 2017. – P. 6230-6239.
20. The Pascal Visual Object Classes (VOC) Challenge / M. Everingham, L. Van Gool, C. K. I. Williams [et al.] // International Journal of Computer Vision. – 2010. – Vol. 88, No. 2. – P. 303-338.
21. Hermann, K. L. The Origins and Prevalence of Texture Bias in Convolutional Neural Networks / K. L. Hermann, T. Chen, S. Kornblith // Advances in Neural Information Processing Systems (NeurIPS). – 2020. – Vol. 33. – P. 19000-19015.
22. Feature Pyramid Networks for Object Detection / T.-Y. Lin, P. Dollar, R. Girshick [et al.] // Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR). – 2017. – P. 936-944.
Опубликован
Выпуск
Раздел
Лицензия

Это произведение доступно по лицензии Creative Commons «Attribution-NonCommercial» («Атрибуция — Некоммерческое использование») 4.0 Всемирная.
Статьи журнала «Вестник Донецкого университета. Серия 04. Технические науки» находятся в открытом доступе и распространяются в соответствии с условиями Лицензионного Договора с Донецким Государственным университетом, который бесплатно предоставляет авторам неограниченное распространение и самостоятельное архивирование.





