LIVE СВЕЖЕЕ
Securityskill-scanner: Анализ безопасности Skill, локальноSecurityskill-safe-install-l0-strict: Безопасная установка скилловTechnical Docsskill-creator: Создание и оптимизация скилловSecuritySecurity Skill: анализ и защита данныхTestingquality-gate: Скилл итеративного улучшения артефактовAutomation To..redis-development: Скилл оптимизации производительности RedisTechnical Docsjsdoc-comment-generator: Скилл для автоматической генерации комментариевNoSQL Databasesbackend-coding-standards: Скилл для стандартизации кодаAutomation To..openapi-spec-generator: Скилл для генерации APIDatabase Toolstype-mapping-encyclopedia: Скилл для преобразования типов данныхSecurityskill-scanner: Анализ безопасности Skill, локальноSecurityskill-safe-install-l0-strict: Безопасная установка скилловTechnical Docsskill-creator: Создание и оптимизация скилловSecuritySecurity Skill: анализ и защита данныхTestingquality-gate: Скилл итеративного улучшения артефактовAutomation To..redis-development: Скилл оптимизации производительности RedisTechnical Docsjsdoc-comment-generator: Скилл для автоматической генерации комментариевNoSQL Databasesbackend-coding-standards: Скилл для стандартизации кодаAutomation To..openapi-spec-generator: Скилл для генерации APIDatabase Toolstype-mapping-encyclopedia: Скилл для преобразования типов данных
$ pwd: ~ / categories / Tools / Automation Tools / add-cuda-kernel-biblioteka-cuda-yader-dlya-uskoreniya-llm
view --main add-cuda-kernel-biblioteka-cuda-yader-dlya-uskoreniya-llm.md

add-cuda-kernel — Библиотека CUDA ядер для ускорения LLM

//

Этот репозиторий предлагает open-source решение для оптимизации развертывания больших языковых моделей (LLM), предоставляя библиотеку ядра FlashInfer. Основная задача – добавление пользовательских CUDA ядер для ускорения операций, таких как поэлементное масштабирование, что критически важно для повышения производительности и снижения задержек.

Инструмент разработчика позволяет интегрировать специализированные ядра, написанные на C++, непосредственно в существующую инфраструктуру FlashInfer. Поддерживаются различные типы данных (FP16, BF16, FP32), что обеспечивает гибкость и совместимость с широким спектром аппаратных конфигураций NVIDIA.

Процесс добавления новых ядер, как показано в примере с операцией масштабирования, включает в себя определение CUDA ядра в include/ и его интеграцию с использованием PyTorch и JIT компиляции. Это обеспечивает автоматизацию процесса оптимизации и упрощает внесение изменений для адаптации к новым требованиям.

Проводник файлов
1 файлы
SKILL.md
readonly --- lines
Инициализация мануала...
package.json
Author
author
⭐ 5.2k | 🍴 834
flashinfer-ai
// Verified Repository Master Account
$ gh browse
$ install --global skills.sh
npx skills add https://github.com/flashinfer-ai/flashinfer/tree/main/.claude/skills/add-cuda-kernel
$ download --local man

[HINT] Скачивает всю директорию скилла с GitHub: SKILL.md и все связанные файлы