LIVE СВЕЖЕЕ
Securityskill-scanner: Анализ безопасности Skill, локальноSecurityskill-safe-install-l0-strict: Безопасная установка скилловTechnical Docsskill-creator: Создание и оптимизация скилловSecuritySecurity Skill: анализ и защита данныхTestingquality-gate: Скилл итеративного улучшения артефактовAutomation To..redis-development: Скилл оптимизации производительности RedisTechnical Docsjsdoc-comment-generator: Скилл для автоматической генерации комментариевNoSQL Databasesbackend-coding-standards: Скилл для стандартизации кодаAutomation To..openapi-spec-generator: Скилл для генерации APIDatabase Toolstype-mapping-encyclopedia: Скилл для преобразования типов данныхSecurityskill-scanner: Анализ безопасности Skill, локальноSecurityskill-safe-install-l0-strict: Безопасная установка скилловTechnical Docsskill-creator: Создание и оптимизация скилловSecuritySecurity Skill: анализ и защита данныхTestingquality-gate: Скилл итеративного улучшения артефактовAutomation To..redis-development: Скилл оптимизации производительности RedisTechnical Docsjsdoc-comment-generator: Скилл для автоматической генерации комментариевNoSQL Databasesbackend-coding-standards: Скилл для стандартизации кодаAutomation To..openapi-spec-generator: Скилл для генерации APIDatabase Toolstype-mapping-encyclopedia: Скилл для преобразования типов данных
$ pwd: ~ / categories / Data & AI / LLM & AI / llm-evaluation-otsenka-i-monitoring-proizvoditelnosti-llm-prilozheniy
view --main llm-evaluation-otsenka-i-monitoring-proizvoditelnosti-llm-prilozheniy.md

llm-evaluation — Оценка и мониторинг производительности LLM приложений

//

Обеспечьте надежную оценку и мониторинг производительности ваших приложений на базе большой языковой модели. Инструмент llm-evaluation предоставляет структурированный фреймворк для систематической оценки, включая автоматизированные метрики и возможности для проведения ручной оценки, что позволяет точно измерять эффективность, сравнивать различные модели и оперативно выявлять регрессии.

Фреймворк поддерживает широкий спектр задач, от оценки генерации текста с использованием метрик, таких как BLEU, ROUGE и BERTScore, до оценки классификации с расчетом точности, полноты и F1-меры. Интеграция с Python и LLMs позволяет автоматизировать процессы оценки и быстро получать обратную связь о качестве работы AI-агента.

llm-evaluation – это не просто набор метрик, это комплексное решение для отслеживания прогресса, выявления проблем и повышения уверенности в стабильности ваших систем, использующих искусственный интеллект. Функциональность включает в себя обнаружение регрессий, отслеживание производительности и поддержку ручной оценки, что критически важно для обеспечения высокого качества работы.

Проводник файлов
1 файлы
SKILL.md
readonly --- lines
Инициализация мануала...
package.json
Author
author
⭐ 32.5k | 🍴 3,538
wshobson
// Verified Repository Master Account
$ gh browse
$ install --global skills.sh
npx skills add https://github.com/wshobson/agents/tree/main/plugins/llm-application-dev/skills/llm-evaluation
$ download --local man

[HINT] Скачивает всю директорию скилла с GitHub: SKILL.md и все связанные файлы