Метод сопоставления записей о ДТП из официальных источников и новостных публикаций на основе пространственно-временной кластеризации
Ключевые слова:
интеграция данных, сопоставление записей, дорожно-транспортные происшествия, газетир, экспертные правила, ST-DBSCAN, большие языковые модели, LLaMAАннотация
Принятие эффективных решений для снижения уровня аварийности на автомобильном транспорте основывается на результатах анализа мест концентрации ДТП. Полнота и точность данных о ДТП, используемых для анализа, могут быть повышены за счет интеграции нескольких источников. Важным этапом интеграции является сопоставление записей из различных источников, описывающих одни и те же события ДТП. Решение задачи сопоставления осложняется проблемой гетерогенности: записи о ДТП могут отличаться по структурированности и формату представления. В исследовании предложен метод решения задачи сопоставления записей о ДТП из двух гетерогенных источников: официальных ресурсов со структурированными карточками учета ДТП и новостных публикаций в виде неструктурированных текстов на естественном языке. Предложенный метод основан на гипотезе о пространственной и временной близости: записи из различных источников считаются соответствующими одному ДТП, если описанные в них события произошли на небольшом расстоянии и с незначительной временной разницей. Метод включает два последовательных этапа. На первом этапе из новостных публикаций извлекаются координаты и дата/время описываемого события с использованием экспертных правил, географического справочника и большой языковой модели LLaMA. На втором этапе выполняется сопоставление записей из официальных ресурсов и новостных публикаций на основе пространственно-временной кластеризации с применением алгоритма ST-DBSCAN. Метод позволяет дополнять описание контекста официально зарегистрированных ДТП и обогащать доступные для анализа данные за счет включения ДТП, сведения о которых отсутствуют в официальных источниках. Экспериментальная оценка метода проведена на реальных данных о ДТП в Санкт-Петербурге. Результаты показали, что комбинирование классических методов с большой языковой моделью повышает точность извлечения пространственно-временных атрибутов ДТП из новостных публикаций, а применение пространственно-временной кластеризации обеспечивает высокую точность сопоставления записей о ДТП (F1-мера = 0.84).
Литература
2. Rabbani M.B.A., Musarat M.A., Alaloul W., et al. Road accident data collection systems in developing and developed countries: a review // International Journal of Integrated Engineering. 2022. vol. 14. no. 1. pp. 336–352. DOI: 10.30880/ijie.2022.14.01.031.
3. Chand A., Jayesh S., Bhasi A.B. Road traffic accidents: An overview of data sources, analysis techniques and contributing factors // Materials Today: Proceedings. 2021. vol. 47. pp. 5135–5141. DOI: 10.1016/j.matpr.2021.05.415.
4. Dos Santos S.R., Jr Davis C.A., Smarzaro R. Integration of data sources on traffic accidents // Proceedings of the XVII GEOINFO. 2016. pp. 93–104.
5. Ali F., Ali A., Imran M., et al. Traffic accident detection and condition analysis based on social networking data // Accident Analysis & Prevention. 2021. vol. 151. 105973 p. DOI: 10.1016/j.aap.2021.105973.
6. Chang H., Li L., Huang J., et al. Tracking traffic congestion and accidents using social media data: A case study of Shanghai // Accident Analysis & Prevention. 2022. vol. 169. 106618 p. DOI: 10.1016/j.aap.2022.106618.
7. Митряев И.С., Новиков А.Н., Кравченко А.А., Еремин С.В. Методы повышения точности извлечения информации из социальных сетей для интеллектуальных транспортных систем // Мир транспорта и технологических машин. 2024. №4-2(87). С. 114–121.
8. Girin A., Teslya N., Shilov N. Overview of Publicly-Available Data Sources on Road Traffic Accidents in Russia // Proceedings of the 10th International Conference on Vehicle Technology and Intelligent Transport Systems (VEHITS). 2024. pp. 480–487. DOI: 10.5220/0012737100003702.
9. Fellegi I.P., Sunter A.B. A Theory for Record Linkage // Journal of the American Statistical Association. 1969. vol. 64. no. 328. pp. 1183–1210. DOI: 10.1080/01621459.1969.10501049.
10. Binette O., Steorts R.C. (Almost) all of entity resolution // Science Advances. 2022. vol. 8. no. 12. eabi8021 p. DOI: 10.1126/sciadv.abi8021.
11. Elmagarmid A.K., Ipeirotis P.G., Verykios V.S. Duplicate Record Detection: A Survey // IEEE Transactions on Knowledge and Data Engineering. 2007. vol. 19. no. 1. pp. 1–16. DOI: 10.1109/TKDE.2007.250581.
12. Mudgal S., Li H., Rekatsinaset T., et al. Deep Learning for Entity Matching: A Design Space Exploration // Proceedings of the International Conference on Management of Data. 2018. pp. 19–34.
13. Li Y., Li J., Suhara Y., et al. Effective entity matching with transformers // The VLDB Journal. 2023. vol. 32. pp. 1215–1235. DOI: 10.1007/s00778-023-00779-z.
14. Li Q., Li J., Sheng J., et al. A Survey on Deep Learning Event Extraction: Approaches and Applications // IEEE Transactions on Neural Networks and Learning Systems. 2024. vol. 35. no. 5. pp. 6301–6321. DOI: 10.1109/TNNLS.2022.3213168.
15. Paganelli M., Tiano D., Del Buono F., et al. How Transformers are Revolutionizing Entity Matching // Proceedings of the 32nd Symposium on Advanced Database Systems. 2024. vol. 3741. pp. 662–670.
16. Peeters R., Steiner A., Bizer C. Entity Matching using Large Language Models // arXiv preprint arXiv:2310.11244. 2023.
17. Marvin G., Hellen N., Jjingo D., et al. Prompt Engineering in Large Language Models // Algorithms for Intelligent Systems. Springer. 2023. pp. 387–402. DOI: 10.1007/978-981-99-7962-2_30.
18. Peeters R., Bizer C. Using ChatGPT for Entity Matching // Communications in Computer and Information Science. Springer. 2023. vol. 1850. pp. 221–230. DOI: 10.1007/978-3-031-42941-5_20.
19. Li H., Li S., Hao F., et al. BoostER: Leveraging Large Language Models for Enhancing Entity Resolution // Companion Proceedings of the ACM Web Conference. 2024. pp. 1043–1046. DOI: 10.1145/3589335.3651245.
20. Touvron H., Lavril T., Izacard G., et al. LLaMA: Open and Efficient Foundation Language Models // arXiv preprint arXiv:2302.13971. 2023.
21. Birant D., Kut A. ST-DBSCAN: An algorithm for clustering spatial–temporal data // Data & Knowledge Engineering. 2007. vol. 60. no. 1. pp. 208–221. DOI: 10.1016/j.datak.2006.01.013.
22. Strotgen J., Gertz M. Heideltime: High quality rule-based extraction and normalization of temporal expressions // Proceedings of the 5th International Workshop on Semantic Evaluation. 2010. pp. 321–324.
23. Giridhar P., Abdelzaher T., George J., et al. On quality of event localization from social network feeds // Proceedings of the IEEE International Conference on Pervasive Computing and Communication Workshops (PerCom Workshops). 2015. pp. 75–80. DOI: 10.1109/PERCOMW.2015.7133997.
24. Milusheva S., Marty R., Bedoya G., et al. Applying machine learning and geolocation techniques to social media data (Twitter) to develop a resource for urban planning // PLOS One. 2021. vol. 16. no. 2. e0244317 p. DOI: 10.1371/journal.pone.0244317.
25. Suat-Rojas N., Gutierrez-Osorio C., Pedraza C. Extraction and Analysis of Social Networks Data to Detect Traffic Accidents // Information. 2022. vol. 13. no. 1. 26 p. DOI: 10.3390/info13010026.
26. Hu X., Zhou Z., Li H., et al. Location Reference Recognition from Texts: A Survey and Comparison // ACM Computing Surveys. 2023. vol. 56. no. 5. pp. 1–37. DOI: 10.1145/3625819.
27. Xiang W., Wang B. A Survey of Event Extraction From Text // IEEE Access. 2019. vol. 7. pp. 173111–173137. DOI: 10.1109/ACCESS.2019.2956831.
28. Hu Y., Mai G., Cundy C., et al. Geo-knowledge-guided GPT models improve the extraction of location descriptions from disaster-related social media messages // International Journal of Geographical Information Science. 2023. vol. 37. no. 11. pp. 2289–2318. DOI: 10.1080/13658816.2023.2266495.
Опубликован
Как цитировать
Раздел
Copyright (c) Алексей Романович Гирин, Николай Николаевич Тесля

Это произведение доступно по лицензии Creative Commons «Attribution» («Атрибуция») 4.0 Всемирная.
Авторы, которые публикуются в данном журнале, соглашаются со следующими условиями: Авторы сохраняют за собой авторские права на работу и передают журналу право первой публикации вместе с работой, одновременно лицензируя ее на условиях Creative Commons Attribution License, которая позволяет другим распространять данную работу с обязательным указанием авторства данной работы и ссылкой на оригинальную публикацию в этом журнале. Авторы сохраняют право заключать отдельные, дополнительные контрактные соглашения на неэксклюзивное распространение версии работы, опубликованной этим журналом (например, разместить ее в университетском хранилище или опубликовать ее в книге), со ссылкой на оригинальную публикацию в этом журнале. Авторам разрешается размещать их работу в сети Интернет (например, в университетском хранилище или на их персональном веб-сайте) до и во время процесса рассмотрения ее данным журналом, так как это может привести к продуктивному обсуждению, а также к большему количеству ссылок на данную опубликованную работу (Смотри The Effect of Open Access).