Фильтрация спама методами глубокого обучения
DOI:
https://doi.org/10.5281/zenodo.14514835Ключевые слова:
фильтрация спама, глубокое обучение, word embedding, TF-IDF, языковая модель, модель Трансформер, многослойный персептрон, метод k-FoldЛицензия
Аннотация
Фильтрация спама относится к задачам классификации естественно-языковых текстов, для решения которой эффективно используются модели глубокого обучения. В статье анализируется возможность применения основных базовых архитектур глубоких сетей к фильтрации спама, таких как сверточные и рекуррентные нейронные сети, а также архитектура Трансформер. Рассмотрены также векторные представления текста на уровне слов и с помощью языковых моделей. Современные языковые модели имеют архитектуру Трансформер, обеспечивают высокую точность классификации, но имеют огромное количество параметров и вычислительную мощность. В связи с этим в работе для фильтрации спама в качестве модели классификации использовался многослойный персептрон, а для получения векторного представления текста – TF-IDF. Такой выбор продиктован необходимостью соблюсти баланс между вычислительной мощностью и точностью. Оценка точности модели осуществлялась кросс-валидацией с разбиением данных методом k-Fold и составила в среднем 99.962%.
Скачивания
Библиографические ссылки
1. Скляренко, Н. С. Разработка спам-фильтра с использованием методов машинного обучения / Н. С. Скляренко // Вестник компьютерных наук. – 2017. – № 4. – С. 45-58.
2. Иванов, П. Н. Фильтрация спама с использованием нейронных сетей / П. Н. Иванов // Программные системы: теория и приложения. – 2020. – Т. 11, № 3. – С. 32-41.
3. Петров, А. В. Методы глубокого обучения для распознавания спам-сообщений / А. В. Петров // Журнал искусственного интеллекта. – 2021. – Т. 12, № 2. – С. 12-24.
4. Григорьев, Д. С. Применение сверточных нейронных сетей для классификации спам-сообщений / Д. С. Григорьев // Труды научных конференций. – 2021. – № 5. – С. 77-85.
5. Тимофеев, В. С. Применение сверточных нейронных сетей для борьбы с рассылкой спама / В. С. Тимофеев // Информационные технологии в безопасности. – 2019. – Т. 14, № 2. – С. 23-36.
6. Гудфеллоу, Я. Глубокое обучение: пер. с англ. / Я. Гудфеллоу, И. Бенджио, А. Курвилль. – М.: ДМК Пресс, 2018. – 652 с.
7. Le, Q. Distributed representations of sentences and documents / Q. Le, T. Mikolov // 31st International Conference on Machine Learning, ICML 2014. – 2014. – V. 4. – P. 1188-1196.
8. Liu, P. Recurrent neural network for text classification with multi-task learning / P. Liu. – 2016. – URL: https://arxiv.org/abs/1605.05101.
9. Kim, Y. Convolutional neural networks for sentence classification / Y. Kim // EMNLP 2014 - 2014 Conference on Empirical Methods in Natural Language Processing, Proceedings of the Conference. – 2014. – P. 1746-1751.
10. Hochreiter, S. Long Short-Term Memory / S. Hochreiter, J. Schmidhuber // Neural Computation. – 2019. – V. 9. – № 8. – P. 1735-1780.
11. Huang, Y. A Comprehensive Review of Transformer Models in Natural Language Processing / Y. Huang, Y. Sui // ACM Computing Surveys. – 2022. – V. 54, № 12. – P. 1-38. – DOI 10.1145/3452805.
REFERENCES LIST
1. Skliarenko, N. S. Razrabotka spam-filtra s ispolzovaniem metodov mashinnogo obucheniia / N. S. Skliarenko // Vestnik kompiuternykh nauk. – 2017. – № 4. – S. 45-58.
2. Ivanov, P. N. Filtratsiia spama s ispolzovaniem neironnykh setei / P. N. Ivanov // Programmnye sistemy: teoriia i prilozheniia. – 2020. – T. 11, № 3. – S. 32-41.
3. Petrov, A. V. Metody glubokogo obucheniia dlia raspoznavaniia spam-soobshchenii / A. V. Petrov // Zhurnal iskusstvennogo intellekta. – 2021. – T. 12, № 2. – S. 12-24.
4. Grigorev, D. S. Primenenie svertochnykh neironnykh setei dlia klassifikatsii spam-soobshchenii / D. S. Grigorev // Trudy nauchnykh konferentsii. – 2021. – № 5. – S. 77-85.
5. Timofeev, V. S. Primenenie svertochnykh neironnykh setei dlia borby s rassylkoi spama / V. S. Timofeev // Informatsionnye tekhnologii v bezopasnosti. – 2019. – T. 14, № 2. – S. 23-36.
6. Gudfellou, Ia. Glubokoe obuchenie: per. s angl. / Ia. Gudfellou, I. Bendzhio, A. Kurvill. – M.: DMK Press, 2018. – 652 s.
7. Le, Q. Distributed representations of sentences and documents / Q. Le, T. Mikolov // 31st International Conference on Machine Learning, ICML 2014. – 2014. – V. 4. – P. 1188-1196.
8. Liu, P. Recurrent neural network for text classification with multi-task learning / P. Liu. – 2016. – URL: https://arxiv.org/abs/1605.05101.
9. Kim, Y. Convolutional neural networks for sentence classification / Y. Kim // EMNLP 2014 - 2014 Conference on Empirical Methods in Natural Language Processing, Proceedings of the Conference. – 2014. – P. 1746-1751.
10. Hochreiter, S. Long Short-Term Memory / S. Hochreiter, J. Schmidhuber // Neural Computation. – 2019. – V. 9. – № 8. – P. 1735-1780.
11. Huang, Y. A Comprehensive Review of Transformer Models in Natural Language Processing / Y. Huang, Y. Sui // ACM Computing Surveys. – 2022. – V. 54, № 12. – P. 1-38. – DOI 10.1145/3452805.
Загрузки
Опубликован
Выпуск
Раздел
Лицензия

Это произведение доступно по лицензии Creative Commons «Attribution-NonCommercial» («Атрибуция — Некоммерческое использование») 4.0 Всемирная.
Статьи журнала «Вестник Донецкого университета. Серия 04. Технические науки» находятся в открытом доступе и распространяются в соответствии с условиями Лицензионного Договора с Донецким Государственным университетом, который бесплатно предоставляет авторам неограниченное распространение и самостоятельное архивирование.





