Ingesting RAG Content — Автоматизированный процесс индексации документов
Решение ingesting-rag-content автоматизирует процесс индексации новых PDF-документов в векторную базу данных Qdrant для приложений с извлечением информации на основе генерации (RAG). Это позволяет быстро интегрировать новые знания в существующую систему, обеспечивая актуальность и точность ответов. Инструмент разработчика значительно упрощает управление контентом и повышает эффективность работы с большими объемами информации.
В основе работы лежит автоматизация обработки PDF-файлов, включая разбиение на фрагменты с использованием стратегии "родитель-потомок" (Parent-Child chunking) для оптимизации поиска. Интеграция с Qdrant обеспечивает эффективное хранение и поиск векторных представлений документов, а также упрощает дальнейшую обработку данных с использованием Python.
Данный open-source решение предназначено для ситуаций, когда необходимо оперативно добавлять новые материалы (например, PDF) в библиотеку знаний проекта или когда агенты обнаруживают новую информацию, требующую постоянного хранения и использования. Для работы требуется среда Python 3.10+ с активной средой cursor-factory и доступ к целевой директории с документами.
$ ls -R related_skills/
npx skills add https://github.com/gitwalter/antigravity-agent-factory/tree/main/.agent/skills/retrieval/ingesting-rag-content
[HINT] Скачивает всю директорию скилла с GitHub: SKILL.md и все связанные файлы