Адаптивный подход к тонкой настройке языковых моделей для задач преобразования текста в SQL

Авторы

  • Босенко Тимур Муртазович ГАОУ ВО «Московский городской педагогический университет» Автор bosenkotm@mgpu.ru

DOI:

https://doi.org/10.5281/zenodo.15056696

Ключевые слова:

Text-to-SQL, языковая модель, SQL-запросы, контролируемая тонкая настройка, CodeS

Лицензия

Метаданные этой статьи распространяются под лицензией CC BY 4.0

Аннотация

Возможность генерации SQL-запросов на основе естественного языка существенно упрощает доступ к данным для пользователей, не обладающих техническими навыками. Современные методы часто полагаются на большие языковые модели (LLM) с закрытым исходным кодом, такие как ChatGPT, которые имеют ограничения, включая высокую стоимость и непрозрачную архитектуру. В данной работе предложен адаптивный подход к тонкой настройке малых языковых моделей (SLM) для преобразования текста в запросы SQL (Text-to-SQL), адаптированных под диалекты SQLite3 и PostgreSQL. Предложенная модель SQL_DS_100M_ft основывается на открытой архитектуре CodeS, что обеспечивает ее гибкость и доступность. Проведённый анализ показал, что тонкая настройка позволяет значительно улучшить точность генерации SQL-запросов (до 72.2% по метрике EX на тестах BIRD) и адаптивность модели для сложных аналитических задач. Основные преимущества таких моделей заключаются в структурированности генерируемых запросов, снижение затрат на вычислительные ресурсы по сравнению с LLM и открывают новые перспективы по улучшению доступности реляционных баз данных через естественно-языковые интерфейсы.

Скачивания

Данные по скачиваниям пока не доступны.

Библиографические ссылки

1. Haoyang, Li [et al] CodeS: Towards Building Open-source Language Models for Text-to-SQL // Proceedings of the ACM on Management of Data. – 2024. – V. 2, № 3. – 28 p. – DOI https://doi.org/10.1145/3654930.

2. Демонстрационная версия преобразования текста в SQL на базе CodeS [Электронный ресурс]. – URL: https://github.com/RUCKBReasoning/text2sql-demo (дата обращения: 01.02.2024).

3. Raymond, Li [et al] StarCoder: May the source be with you! [Электронный ресурс]. – 2023. – CoRR abs/2305.06161. – URL: https://arxiv.org/abs/2305.06161 (дата обращения: 12.03.2024).

4. Tao, Yu [et al] Spider: A Large-Scale Human-Labeled Dataset for Complex and Cross-Domain Semantic Parsing and Text-to-SQL Task [Электронный ресурс]. – 2019. – URL: https://arxiv.org/abs/1809.08887 (дата обращения: 12.10.2024).

5. Jinyang, Li [et al] Can LLM Already Serve as A Database Interface? A BIg Bench for Large-Scale Database Grounded Text-to-SQLs [Электронный ресурс]. – 2023. – URL: https://arxiv.org/abs/2305.03111 (дата обращения: 01.10.2024).

6. Vaswani, A. [et al] Attention is All You Need // Advances in Neural Information Processing Systems 30: Annual Conference on Neural Information Processing Systems 2017. – 2017, Long Beach, CA, USA. – 2017. – P. 5998–6008.

7. Radford, A. [et al] Improving language understanding by generative pre-training [Электронный ресурс]. – 2018. – URL: https://cdn.openai.com/research-covers/language-unsupervised/language_understanding

_paper.pdf (дата обращения: 10.11.2024).

8. Touvron, H. [et al] LLaMA: Open and Efficient Foundation Language Models // CoRR abs/2302.13971. – 2023. – URL: https://arxiv.org/abs/2302.13971 (дата обращения: 12.10.2024).

9. Yin, P. [et al] TaBERT: Pretraining for Joint Understanding of Textual and Tabular Data // Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics. – 2020. – P. 8413–8426.

10. Raffel, C. [et al] Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer // J. Mach. Learn. Res. – 2020. – V. 21. – P. 140:1–140:67.

11. Wei, J. [et al] Chain-of-Thought Prompting Elicits Reasoning in Large Language Models [Электронный ресурс] // NeurIPS. – 2022. – URL: https://arxiv.org/abs/2201.11903 (дата обращения: 15.06.2024).

12. Yu, T. [et al] Spider: A Large-Scale Human-Labeled Dataset for Complex and Cross-Domain Semantic Parsing and Text-to-SQL Task [Электронный ресурс]. – 2019. – URL: https://arxiv.org/abs/1809.08887 (дата обращения: 15.06.2024).

13. Zhong, V. [et al] Seq2SQL: Generating Structured Queries from Natural Language using Reinforcement Learning [Электронный ресурс]. – 2017. – URL: https://arxiv.org/abs/1709.00103 (дата обращения: 12.06.2024).

14. Yu, T. [et al] CoSQL: A Conversational Text-to-SQL Challenge Towards Cross-Domain Natural Language Interfaces to Databases [Электронный ресурс]. – 2019. – URL: https://arxiv.org/abs/1909.05378 (дата обращения: 15.06.2024).

15. Yu, T. [et al] SParC: Cross-Domain Semantic Parsing in Context [Электронный ресурс]. – 2019. – URL: https://arxiv.org/abs/1906.02285 (дата обращения: 01.12.2023).

16. Li, J. [et al] Can LLM Already Serve as a Database Interface? A Big Bench for Large-Scale Database Grounded Text-to-SQLs // CoRR. – 2023. – Vol. abs/2305.03111. – URL: https://arxiv.org/abs/2305.03111 (дата обращения: 11.09.2024).

17. Модель SQLCoder-7B-2. Большая языковая модель для генерации SQL-кода на естественном языке [Электронный ресурс]. – URL: https://huggingface.co/defog/sqlcoder-7b-2 (дата обращения: 11.09.2024).

18. Леонхардт, Х. Text2SQL (Revision c06880d) [Электронный ресурс]. – 2024. – URL: https://huggingface.co/juanfra218/text2sql (дата обращения: 12.10.2024). – DOI 10.57967/hf/2897.

19. Модель WPAIGPT-sql-01. Большая языковая модель для генерации SQL-кода на естественном языке [Электронный ресурс]. – URL: https://huggingface.co/WPAI-INC/WPAIGPT-sql-01 (дата обращения: 10.09.2024).

REFERENCES LIST

1. Haoyang, Li [et al] CodeS: Towards Building Open-source Language Models for Text-to-SQL // Proceedings of the ACM on Management of Data. – 2024. – V. 2, № 3. – 28 p. – DOI https://doi.org/10.1145/3654930.

2. Demonstratsionnaia versiia preobrazovaniia teksta v SQL na baze CodeS [Elektronnyi resurs]. – URL: https://github.com/RUCKBReasoning/text2sql-demo (data obrashcheniia: 01.02.2024).

3. Raymond, Li [et al] StarCoder: May the source be with you! [Elektronnyi resurs]. – 2023. – CoRR abs/2305.06161. – URL: https://arxiv.org/abs/2305.06161 (data obrashcheniia: 12.03.2024).

4. Tao, Yu [et al] Spider: A Large-Scale Human-Labeled Dataset for Complex and Cross-Domain Semantic Parsing and Text-to-SQL Task [Elektronnyi resurs]. – 2019. – URL: https://arxiv.org/abs/1809.08887 (data obrashcheniia: 12.10.2024).

5. Jinyang, Li [et al] Can LLM Already Serve as A Database Interface? A BIg Bench for Large-Scale Database Grounded Text-to-SQLs [Elektronnyi resurs]. – 2023. – URL: https://arxiv.org/abs/2305.03111 (data obrashcheniia: 01.10.2024).

6. Vaswani, A. [et al] Attention is All You Need // Advances in Neural Information Processing Systems 30: Annual Conference on Neural Information Processing Systems 2017. – 2017, Long Beach, CA, USA. – 2017. – P. 5998–6008.

7. Radford, A. [et al] Improving language understanding by generative pre-training [Elektronnyi resurs]. – 2018. – URL: https://cdn.openai.com/research-covers/language-unsupervised/language_understanding

_paper.pdf (data obrashcheniia: 10.11.2024).

8. Touvron, H. [et al] LLaMA: Open and Efficient Foundation Language Models // CoRR abs/2302.13971. – 2023. – URL: https://arxiv.org/abs/2302.13971 (data obrashcheniia: 12.10.2024).

9. Yin, P. [et al] TaBERT: Pretraining for Joint Understanding of Textual and Tabular Data // Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics. – 2020. – P. 8413–8426.

10. Raffel, C. [et al] Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer // J. Mach. Learn. Res. – 2020. – V. 21. – P. 140:1–140:67.

11. Wei, J. [et al] Chain-of-Thought Prompting Elicits Reasoning in Large Language Models [Elektronnyi resurs] // NeurIPS. – 2022. – URL: https://arxiv.org/abs/2201.11903 (data obrashcheniia: 15.06.2024).

12. Yu, T. [et al] Spider: A Large-Scale Human-Labeled Dataset for Complex and Cross-Domain Semantic Parsing and Text-to-SQL Task [Elektronnyi resurs]. – 2019. – URL: https://arxiv.org/abs/1809.08887 (data obrashcheniia: 15.06.2024).

13. Zhong, V. [et al] Seq2SQL: Generating Structured Queries from Natural Language using Reinforcement Learning [Elektronnyi resurs]. – 2017. – URL: https://arxiv.org/abs/1709.00103 (data obrashcheniia: 12.06.2024).

14. Yu, T. [et al] CoSQL: A Conversational Text-to-SQL Challenge Towards Cross-Domain Natural Language Interfaces to Databases [Elektronnyi resurs]. – 2019. – URL: https://arxiv.org/abs/1909.05378 (data obrashcheniia: 15.06.2024).

15. Yu, T. [et al] SParC: Cross-Domain Semantic Parsing in Context [Elektronnyi resurs]. – 2019. – URL: https://arxiv.org/abs/1906.02285 (data obrashcheniia: 01.12.2023).

16. Li, J. [et al] Can LLM Already Serve as a Database Interface? A Big Bench for Large-Scale Database Grounded Text-to-SQLs // CoRR. – 2023. – Vol. abs/2305.03111. – URL: https://arxiv.org/abs/2305.03111 (data obrashcheniia: 11.09.2024).

17. Model SQLCoder-7B-2. Bolshaia iazykovaia model dlia generatsii SQL-koda na estestvennom iazyke [Elektronnyi resurs]. – URL: https://huggingface.co/defog/sqlcoder-7b-2 (data obrashcheniia: 11.09.2024).

18. Leonkhardt, Kh. Text2SQL (Revision c06880d) [Elektronnyi resurs]. – 2024. – URL: https://huggingface.co/juanfra218/text2sql (data obrashcheniia: 12.10.2024). – DOI 10.57967/hf/2897.

19. Model WPAIGPT-sql-01. Bolshaia iazykovaia model dlia generatsii SQL-koda na estestvennom iazyke [Elektronnyi resurs]. – URL: https://huggingface.co/WPAI-INC/WPAIGPT-sql-01 (data obrashcheniia: 10.09.2024).

Загрузки

Опубликован

28.02.2025

Выпуск

Раздел

ИНФОРМАЦИОННЫЕ ТЕХНОЛОГИИ И ТЕЛЕКОММУНИКАЦИИ

Как цитировать

[1]
2025. Адаптивный подход к тонкой настройке языковых моделей для задач преобразования текста в SQL. Вестник Донецкого университета. Серия 04. Технические науки. 1 (Feb. 2025), 85–92. DOI:https://doi.org/10.5281/zenodo.15056696.