video-understanding — ИИ для анализа и понимания видеоконтента
Решение сложной задачи извлечения информации из видеоконтента стало доступным благодаря искусственному интеллекту. Инструмент анализирует видео, используя возможности Google Gemini, предоставляя точные расшифровки, подробные описания, краткие содержания и ответы на вопросы, основанные на визуальном и аудио сопровождении. Поддерживается более 1000 источников видео, что обеспечивает гибкость в работе с различными платформами.
Функциональность инструмента включает в себя автоматическую транскрибацию с указанием временных меток, генерацию описаний визуального контента (люди, окружение, интерфейс, текст на экране), а также ответы на вопросы, сформулированные пользователем. В основе лежит большая языковая модель Google Gemini, обеспечивающая глубокое понимание контекста и нюансов видео. Для работы требуется переменная окружения GEMINI_API_KEY.
Инструмент позволяет автоматизировать рутинные задачи анализа видео, предоставляя структурированный JSON-вывод, содержащий расшифровку, описание, краткое содержание, продолжительность и, при необходимости, ответы на вопросы. Это открывает новые возможности для создания AI-агентов и автоматизации процессов, связанных с обработкой видеоданных.
$ ls -R related_skills/
npx skills add https://github.com/openclaw/skills/tree/main/skills/bill492/video-understanding
[HINT] Скачивает всю директорию скилла с GitHub: SKILL.md и все связанные файлы