LIVE СВЕЖЕЕ
Securityskill-scanner: Анализ безопасности Skill, локальноSecurityskill-safe-install-l0-strict: Безопасная установка скилловTechnical Docsskill-creator: Создание и оптимизация скилловSecuritySecurity Skill: анализ и защита данныхTestingquality-gate: Скилл итеративного улучшения артефактовAutomation To..redis-development: Скилл оптимизации производительности RedisTechnical Docsjsdoc-comment-generator: Скилл для автоматической генерации комментариевNoSQL Databasesbackend-coding-standards: Скилл для стандартизации кодаAutomation To..openapi-spec-generator: Скилл для генерации APIDatabase Toolstype-mapping-encyclopedia: Скилл для преобразования типов данныхSecurityskill-scanner: Анализ безопасности Skill, локальноSecurityskill-safe-install-l0-strict: Безопасная установка скилловTechnical Docsskill-creator: Создание и оптимизация скилловSecuritySecurity Skill: анализ и защита данныхTestingquality-gate: Скилл итеративного улучшения артефактовAutomation To..redis-development: Скилл оптимизации производительности RedisTechnical Docsjsdoc-comment-generator: Скилл для автоматической генерации комментариевNoSQL Databasesbackend-coding-standards: Скилл для стандартизации кодаAutomation To..openapi-spec-generator: Скилл для генерации APIDatabase Toolstype-mapping-encyclopedia: Скилл для преобразования типов данных
$ pwd: ~ / categories / Lifestyle / Philosophy & Ethics / awareness-skill-kompleksnyy-benchmark-dlya-otsenki-llm
view --main awareness-skill-kompleksnyy-benchmark-dlya-otsenki-llm.md

Awareness Skill — Комплексный бенчмарк для оценки LLM

//

Оценивает надёжность больших языковых моделей (LLM) посредством бенчмарка, фокусирующегося на самосознании, обнаружении ошибок и откалиброванной уверенности в ответах. Решает проблему ненадежности LLM путем оценки способности модели к самокритике и осознанию границ своих знаний. Ориентирован на повышение качества ответов, особенно в ситуациях, когда модель предоставляет фактические данные, рекомендации по коду или архитектурные решения.

Бенчмарк проверяет LLM на соответствие 17 когнитивным измерениям, включая выявление потенциальных ошибок и самокоррекцию. Инструмент оценивает ответы моделей от разных провайдеров (Anthropic, OpenAI) и использует систему обнаружения "красных фраз" (например, "Все знают...", "Очевидно...") для выявления и перефразирования потенциально вводящих в заблуждение утверждений. Особое внимание уделяется выявлению неопределенности, связанной со временем и версиями.

Разработан на Python. Включает многопоставную систему оценки, детектор "красных фраз" и логику для флагов неопределенности. Интегрируется с API различных LLM. Предназначен для использования в процессе разработки и улучшения LLM.

Проводник файлов
1 файлы
SKILL.md
readonly --- lines
Инициализация мануала...
package.json
Author
author
⭐ 0 | 🍴 0
fabioc-aloha
// Verified Repository Master Account
$ gh browse
$ install --global skills.sh
npx skills add https://github.com/fabioc-aloha/BrainBenchmark/tree/main/.github/skills/awareness
$ download --local man

[HINT] Скачивает всю директорию скилла с GitHub: SKILL.md и все связанные файлы