LIVE СВЕЖЕЕ
Securityskill-scanner: Анализ безопасности Skill, локальноSecurityskill-safe-install-l0-strict: Безопасная установка скилловTechnical Docsskill-creator: Создание и оптимизация скилловSecuritySecurity Skill: анализ и защита данныхTestingquality-gate: Скилл итеративного улучшения артефактовAutomation To..redis-development: Скилл оптимизации производительности RedisTechnical Docsjsdoc-comment-generator: Скилл для автоматической генерации комментариевNoSQL Databasesbackend-coding-standards: Скилл для стандартизации кодаAutomation To..openapi-spec-generator: Скилл для генерации APIDatabase Toolstype-mapping-encyclopedia: Скилл для преобразования типов данныхSecurityskill-scanner: Анализ безопасности Skill, локальноSecurityskill-safe-install-l0-strict: Безопасная установка скилловTechnical Docsskill-creator: Создание и оптимизация скилловSecuritySecurity Skill: анализ и защита данныхTestingquality-gate: Скилл итеративного улучшения артефактовAutomation To..redis-development: Скилл оптимизации производительности RedisTechnical Docsjsdoc-comment-generator: Скилл для автоматической генерации комментариевNoSQL Databasesbackend-coding-standards: Скилл для стандартизации кодаAutomation To..openapi-spec-generator: Скилл для генерации APIDatabase Toolstype-mapping-encyclopedia: Скилл для преобразования типов данных
$ pwd: ~ / categories / Tools / IDE Plugins / lmms-eval-guide-kompleksnaya-otsenka-proizvoditelnosti-llm-i-multimodalnyh-modeley
view --main lmms-eval-guide-kompleksnaya-otsenka-proizvoditelnosti-llm-i-multimodalnyh-modeley.md

lmms-eval-guide — Комплексная оценка производительности LLM и мультимодальных моделей

//

lmms-eval – это комплексный инструментарий для оценки производительности больших языковых моделей (LLMs) и мультимодальных моделей, охватывающий задачи обработки текста, изображений, видео и аудио. Он решает проблему отсутствия стандартизированной и гибкой системы оценки, позволяя разработчикам и исследователям получать объективные данные о возможностях AI-агентов и быстро адаптировать процесс оценки к новым моделям и задачам.

Инструментарий предоставляет обширную поддержку различных моделей (95 бэкендов, включая 14 чат-моделей и 81 legacy/простых), библиотеку задач (230 задач) и настраиваемые рабочие процессы оценки, определяемые через файлы YAML. Технический стек включает Python, YAML, HTTP API и Markdown, обеспечивая удобство интеграции и расширяемость.

lmms-eval позволяет добавлять и обновлять бэкенды моделей, определять новые задачи, запускать оценки с использованием конфигураций YAML, интегрировать оценку в процессы обучения через асинхронный API и отлаживать сбои в конвейере. Это ключевой компонент для оценки и улучшения искусственного интеллекта, особенно при работе с мультимодальными системами.

Проводник файлов
1 файлы
SKILL.md
readonly --- lines
Инициализация мануала...
package.json
Author
author
⭐ 3.9k | 🍴 548
EvolvingLMMs-Lab
// Verified Repository Master Account
$ gh browse
$ install --global skills.sh
npx skills add https://github.com/EvolvingLMMs-Lab/lmms-eval/tree/main/skills/lmms-eval-guide
$ download --local man

[HINT] Скачивает всю директорию скилла с GitHub: SKILL.md и все связанные файлы