For the complete documentation index, see llms.txt. This page is also available as Markdown.

Бенчмарк DMind

DMind Benchmark — это набор для оценки понимания Web3 в больших языковых моделях. Он был принят в трек Datasets & Benchmarks конференции KDD 2026 из 513 заявок (уровень принятия около 29%) и будет представлен на основной конференции в Чеджу, Южная Корея, в августе 2026 года.

Набор данных открыт и был скачан более 13 000 раз с Hugging Face. Это самый используемый артефакт в экосистеме DMind.

Что он охватывает

1 917 вопросов, проверенных экспертами, по 9 субдоменам Web3:

  1. Базовые концепции блокчейна: хеширование, деревья Меркла, консенсус, PoW/PoS, структура блока, форки.

  2. Инфраструктура блокчейна: Layer-1 против Layer-2 (Optimistic vs ZK Rollups), мосты, архитектура узлов, RPC.

  3. Смарт-контракты: Solidity, механика вызовов, хранилище, байткод EVM, шаблоны обновления.

  4. Механизмы DeFi: математика AMM, модели процентных ставок кредитования, логика ликвидации, ценообразование деривативов.

  5. DAO: токены управления, голосование, предложения, кворум, timelock-замки.

  6. NFT: стандарты ERC-721/1155, механика роялти, минимальная цена, кредитование NFT.

  7. Токеномика: выпуск, вестинг, сжигание, согласование стимулов, ценообразование.

  8. Мем-концепции: специфичные для крипто культурные термины и динамика мем-токенов.

  9. Уязвимости безопасности: реентерабельность, атаки с использованием flash loan, манипуляция оракулами, повторное воспроизведение подписи, типичные замечания аудита.

Форматы вопросов

В бенчмарке используются два типа вопросов. Вопросы с несколькими вариантами ответа проверяют фактическое запоминание. Задания с открытым ответом включают отладку смарт-контрактов, где модели нужно найти уязвимость во фрагменте Solidity, и численное рассуждение в блокчейне, где модели даётся состояние пула AMM и нужно вычислить прибыль от конкретного вектора атаки.

Задания с открытым ответом намеренно сложнее, чем вопросы с выбором ответа. Модель может решать вопросы с выбором ответа, просто сопоставляя шаблоны. Численное рассуждение и анализ кода требуют реально решать задачу.

Что обнаружила статья

В последней версии бенчмарка были оценены 31 популярная большая модель, включая GPT-5, Claude Sonnet 4.5, DeepSeek, Gemini, Grok и серию Qwen. Выделяются три вывода.

Базовые вещи в основном решены, глубина — нет

Все крупные модели показывают неплохие результаты на базовых концепциях блокчейна — на том материале, который можно найти в Википедии. Производительность резко падает на токеномике, мем-концепциях и безопасности. Именно в этих областях Web3-экспертиза действительно важна, и именно здесь универсальные модели склонны придумывать правдоподобные, но неверные ответы.

Стоимость и точность не движутся вместе

Если построить график точности в зависимости от стоимости за токен, видна чёткая граница Парето. Серия GPT-5 находится на высокоточном конце. Некоторые открытые модели, включая GPT-OSS-120B, Kimi K2 и Qwen3-235B Thinking, предлагают лучшее соотношение цены и качества в середине диапазона. Несколько известных закрытых моделей оказываются и дорогими, и более слабыми, чем альтернативы, именно в задачах Web3. В статье публикуются все данные, чтобы числа можно было воспроизвести.

Дообучение на большем объёме данных не сокращает разрыв

В статье проводится контролируемый эксперимент. Берутся три базовые модели (QwQ-32B, Qwen3-32B, DeepSeek-R1-Distill-Llama-70B), каждая дообучается на полном наборе данных бенчмарка с помощью LoRA, и измеряется прирост. Кривые обучения остаются пологими. Добавление большего объёма данных не раскрывает Web3-рассуждение. Настоящее узкое место — многошаговый вывод, связь между разными концепциями и понимание рынка, который меняется со временем. Это аргумент в пользу новых методов обучения, а не более крупных обучающих наборов данных, и причина, по которой DMind вложился в HPS и C³-SFT (см. Методы обучения).

Где это читать

Последнее обновление

Это было полезно?