Репозиторий содержит программную реализацию пайплайна автоматизированного извлечения химических сущностей, генерации ключевых слов и структурирования метаданных из массива научных публикаций.
Современные научные базы данных содержат огромные массивы неструктурированного текста. Данный пайплайн решает задачу преобразования сырых текстов научных статей в структурированный машиночитаемый формат.
Система реализует следующие ключевые функции:
- Автоматическое распознавание химических элементов, соединений и материалов с использованием специализированной библиотеки
ChemDataExtractor. - Извлечение наиболее релевантных терминов из полного текста статьи с применением статистического алгоритма
YAKE(Yet Another Keyword Extractor), не требующего предварительного обучения модели. - Классификация статей по заданным тематическим категориям (например, металлы, композитные материалы, нанотехнологии) на основе совпадения с эталонными словарями.
- Формирование единого стандартизированного JSON-формата для последующего импорта в базы данных или проведения аналитических исследований.
- Язык программирования: Python 3.11+
- Извлечение химических сущностей:
chemdataextractor>=2.0 - Генерация ключевых слов:
yake>=0.4.8 - Обработка данных:
json,re(стандартные библиотеки Python) - Хранилище данных: Локальные структурированные JSON-файлы
Убедитесь, что на вашем компьютере установлен Python 3.11 или выше.
- Клонируйте репозиторий:
git clone https://github.com/armatveeeva/scientific-articles-processor.git
cd scientific-articles-processor