Бенчмарк DMind
DMind Benchmark — это набор для оценки понимания Web3 в больших языковых моделях. Он был принят в трек Datasets & Benchmarks конференции KDD 2026 из 513 заявок (уровень принятия около 29%) и будет представлен на основной конференции в Чеджу, Южная Корея, в августе 2026 года.
Набор данных открыт и был скачан более 13 000 раз с Hugging Face. Это самый используемый артефакт в экосистеме DMind.
Что он охватывает
1 917 вопросов, проверенных экспертами, по 9 субдоменам Web3:
Базовые концепции блокчейна: хеширование, деревья Меркла, консенсус, PoW/PoS, структура блока, форки.
Инфраструктура блокчейна: Layer-1 против Layer-2 (Optimistic vs ZK Rollups), мосты, архитектура узлов, RPC.
Смарт-контракты: Solidity, механика вызовов, хранилище, байткод EVM, шаблоны обновления.
Механизмы DeFi: математика AMM, модели процентных ставок кредитования, логика ликвидации, ценообразование деривативов.
DAO: токены управления, голосование, предложения, кворум, timelock-замки.
NFT: стандарты ERC-721/1155, механика роялти, минимальная цена, кредитование NFT.
Токеномика: выпуск, вестинг, сжигание, согласование стимулов, ценообразование.
Мем-концепции: специфичные для крипто культурные термины и динамика мем-токенов.
Уязвимости безопасности: реентерабельность, атаки с использованием flash loan, манипуляция оракулами, повторное воспроизведение подписи, типичные замечания аудита.
Форматы вопросов
В бенчмарке используются два типа вопросов. Вопросы с несколькими вариантами ответа проверяют фактическое запоминание. Задания с открытым ответом включают отладку смарт-контрактов, где модели нужно найти уязвимость во фрагменте Solidity, и численное рассуждение в блокчейне, где модели даётся состояние пула AMM и нужно вычислить прибыль от конкретного вектора атаки.
Задания с открытым ответом намеренно сложнее, чем вопросы с выбором ответа. Модель может решать вопросы с выбором ответа, просто сопоставляя шаблоны. Численное рассуждение и анализ кода требуют реально решать задачу.
Что обнаружила статья
В последней версии бенчмарка были оценены 31 популярная большая модель, включая GPT-5, Claude Sonnet 4.5, DeepSeek, Gemini, Grok и серию Qwen. Выделяются три вывода.
Базовые вещи в основном решены, глубина — нет
Все крупные модели показывают неплохие результаты на базовых концепциях блокчейна — на том материале, который можно найти в Википедии. Производительность резко падает на токеномике, мем-концепциях и безопасности. Именно в этих областях Web3-экспертиза действительно важна, и именно здесь универсальные модели склонны придумывать правдоподобные, но неверные ответы.
Стоимость и точность не движутся вместе
Если построить график точности в зависимости от стоимости за токен, видна чёткая граница Парето. Серия GPT-5 находится на высокоточном конце. Некоторые открытые модели, включая GPT-OSS-120B, Kimi K2 и Qwen3-235B Thinking, предлагают лучшее соотношение цены и качества в середине диапазона. Несколько известных закрытых моделей оказываются и дорогими, и более слабыми, чем альтернативы, именно в задачах Web3. В статье публикуются все данные, чтобы числа можно было воспроизвести.
Дообучение на большем объёме данных не сокращает разрыв
В статье проводится контролируемый эксперимент. Берутся три базовые модели (QwQ-32B, Qwen3-32B, DeepSeek-R1-Distill-Llama-70B), каждая дообучается на полном наборе данных бенчмарка с помощью LoRA, и измеряется прирост. Кривые обучения остаются пологими. Добавление большего объёма данных не раскрывает Web3-рассуждение. Настоящее узкое место — многошаговый вывод, связь между разными концепциями и понимание рынка, который меняется со временем. Это аргумент в пользу новых методов обучения, а не более крупных обучающих наборов данных, и причина, по которой DMind вложился в HPS и C³-SFT (см. Методы обучения).
Где это читать
Статья: arXiv:2504.16116
Набор данных: huggingface.co/datasets/DMindAI/DMind_Benchmark
Рецензия KDD 2026: форум OpenReview
Последнее обновление
Это было полезно?

