Wednesday, August 19, 2026

Как оценивать системы ИИ

Разработка и полезность надёжных продуктов и услуг искусственного интеллекта (ИИ) во многом зависят от надёжных измерений и оценок базовых технологий и их использования. Это растущая область глобального значения — и NIST проводит исследования и разработку метрик, измерений и методов оценки в новых и существующих областях ИИ.

Первоначальный публичный проект NIST AI 200-2 TEVV-Athlon для оценки систем искусственного интеллекта, опубликован для общественного обсуждения. Методология тестирования, оценки, проверки и валидации (TEVV) является ключевым компонентом строгих оценок ИИ, которые измеряют, тестируют и формируют доверие к системам и программным моделям ИИ. Этот первоначальный публичный проект представляет рамочную систему TEVV-Athlon — структурированный подход для оценки реального влияния и результатов систем ИИ. Цель состоит в том, чтобы этот новый фреймворк был расширяемым, адаптивным и настраиваемым для поддержки широкого спектра приложений ИИ (включая статистические модели машинного обучения, модели больших языков, мультимодальные модели, агентные системы и многие другие типы технологий ИИ).

No comments: