LIVE СВЕЖЕЕ
Securityskill-scanner: Анализ безопасности Skill, локальноSecurityskill-safe-install-l0-strict: Безопасная установка скилловTechnical Docsskill-creator: Создание и оптимизация скилловSecuritySecurity Skill: анализ и защита данныхTestingquality-gate: Скилл итеративного улучшения артефактовAutomation To..redis-development: Скилл оптимизации производительности RedisTechnical Docsjsdoc-comment-generator: Скилл для автоматической генерации комментариевNoSQL Databasesbackend-coding-standards: Скилл для стандартизации кодаAutomation To..openapi-spec-generator: Скилл для генерации APIDatabase Toolstype-mapping-encyclopedia: Скилл для преобразования типов данныхSecurityskill-scanner: Анализ безопасности Skill, локальноSecurityskill-safe-install-l0-strict: Безопасная установка скилловTechnical Docsskill-creator: Создание и оптимизация скилловSecuritySecurity Skill: анализ и защита данныхTestingquality-gate: Скилл итеративного улучшения артефактовAutomation To..redis-development: Скилл оптимизации производительности RedisTechnical Docsjsdoc-comment-generator: Скилл для автоматической генерации комментариевNoSQL Databasesbackend-coding-standards: Скилл для стандартизации кодаAutomation To..openapi-spec-generator: Скилл для генерации APIDatabase Toolstype-mapping-encyclopedia: Скилл для преобразования типов данных
$ pwd: ~ / categories / Research / Scientific Computing / benchmark-kernel-tochnaya-otsenka-proizvoditelnosti-llm-bekendov
view --main benchmark-kernel-tochnaya-otsenka-proizvoditelnosti-llm-bekendov.md

benchmark-kernel — Точная оценка производительности LLM бэкендов

//

benchmark-kernel предоставляет комплексную систему для точной оценки и сравнения производительности различных бэкендов для обслуживания больших языковых моделей (LLM). Она решает проблему неточного измерения времени выполнения GPU-ядер, что критически важно для оптимизации AI-агентов и улучшения эффективности работы с большой языковой моделью. Фреймворк использует Python, CUDA, PyTorch и CUPTI для получения надежных результатов.

Ключевой особенностью является точная синхронизация GPU-ядер с использованием CUPTI (предпочтительно) или событий CUDA, что позволяет исключить накладные расходы на передачу данных между хостом и устройством. Поддерживается сравнение различных реализаций, включая FlashAttention2/3, cuDNN, CUTLASS и TensorRT-LLM, обеспечивая всестороннюю оценку производительности. Результаты сохраняются в формате CSV для последующего анализа и интеграции в процессы разработки искусственного интеллекта.

Фреймворк обеспечивает воспроизводимость результатов и автоматический выбор метода синхронизации (CUPTI или события CUDA) в зависимости от доступности. Это позволяет разработчикам быстро и эффективно выявлять узкие места и оптимизировать производительность своих решений, связанных с LLM и AI-агентами.

Проводник файлов
1 файлы
SKILL.md
readonly --- lines
Инициализация мануала...
package.json
Author
author
⭐ 5.2k | 🍴 834
flashinfer-ai
// Verified Repository Master Account
$ gh browse
$ install --global skills.sh
npx skills add https://github.com/flashinfer-ai/flashinfer/tree/main/.claude/skills/benchmark-kernel
$ download --local man

[HINT] Скачивает всю директорию скилла с GitHub: SKILL.md и все связанные файлы