Awareness Skill — Комплексный бенчмарк для оценки LLM
Оценивает надёжность больших языковых моделей (LLM) посредством бенчмарка, фокусирующегося на самосознании, обнаружении ошибок и откалиброванной уверенности в ответах. Решает проблему ненадежности LLM путем оценки способности модели к самокритике и осознанию границ своих знаний. Ориентирован на повышение качества ответов, особенно в ситуациях, когда модель предоставляет фактические данные, рекомендации по коду или архитектурные решения.
Бенчмарк проверяет LLM на соответствие 17 когнитивным измерениям, включая выявление потенциальных ошибок и самокоррекцию. Инструмент оценивает ответы моделей от разных провайдеров (Anthropic, OpenAI) и использует систему обнаружения "красных фраз" (например, "Все знают...", "Очевидно...") для выявления и перефразирования потенциально вводящих в заблуждение утверждений. Особое внимание уделяется выявлению неопределенности, связанной со временем и версиями.
Разработан на Python. Включает многопоставную систему оценки, детектор "красных фраз" и логику для флагов неопределенности. Интегрируется с API различных LLM. Предназначен для использования в процессе разработки и улучшения LLM.
$ ls -R related_skills/
Basis-Fundamenten Schrijver — Разработка этического фундамента для будущего
Strong’s Concordance Lookup — Инструмент для поиска библейских слов
Скилл comparative-morphological-analysis-engine: анализ анатомии насекомых
skill-physics-research — Автоматизация исследований в физике с AI
npx skills add https://github.com/fabioc-aloha/BrainBenchmark/tree/main/.github/skills/awareness
[HINT] Скачивает всю директорию скилла с GitHub: SKILL.md и все связанные файлы