For the complete documentation index, see llms.txt. This page is also available as Markdown.

Методы обучения

Модели DMind сочетают два оригинальных метода обучения (HPS и C³-SFT) со стандартными методами, такими как SFT, RLHF, LoRA и дистилляция. На этой странице кратко рассматривается каждый из них и указано, какая модель что использует.

Базовые модели

Серия
Параметры
База
Провайдер базы
Роль

DMind-3

21B

gpt-oss-20b

ChatGPT

Облачный и корпоративный VPC-движок макростратегии для системного риска, кросс-чейн нарративов, институциональных исследований и оркестрации агентов.

DMind-3

4B

Qwen3.5-4B

Qwen

Локальная модель финансового моделирования и стратегического рассуждения. В первую очередь ориентирована на конфиденциальность, доступна офлайн, с глубоким рассуждением на устройстве.

DMind-3

270M

functiongemma-270m-it

Gemini

Распознавание намерений кошелька и DEX на устройстве и вызов функций. Поддерживает SEARCH_TOKEN и EXECUTE_SWAP, мультичейн, а также намерения на китайском и английском языках.

DMind-2

107B

GLM-4.5-Air

GLM

Флагманская модель анализа криптоинвестиций. Охватывает макротренды через ончейн-поведение, для профессионального консультирования и институционального анализа.

DMind-2

4B

Qwen3-4B-Thinking-2507

Qwen

Лёгкая модель анализа криптоинвестиций для локального и пограничного развертывания, конфиденциальности и использования с низкой задержкой.

DMind-1

33B

Qwen3-32B

Qwen

Экспертная Web3-модель для DeFi, токеномики, управления и вопросов-ответов и рассуждений по смарт-контрактам.

DMind-1

15B

Qwen3-14B

Qwen

Лёгкая дистиллированная версия DMind-1. Подходит для вопросов-ответов в реальном времени с низкой задержкой, ончейн-анализа и лёгких агентов.

Использование моделей DMind требует соблюдения как Соглашения о моделях DMind, так и исходной лицензии базовой модели.

Стандартные методы

Обучение с учителем (SFT)

Базовый метод. Сопоставляют вопросы с эталонными ответами и обучают модель им соответствовать. Первый этап обучения DMind-1 использует SFT.

LoRA (низкоранговая адаптация)

Параметроэффективный способ выполнять SFT. Вместо обновления всех параметров модели LoRA добавляет к каждому слою небольшую пару низкоранговых матриц и обучает только их. Это снижает стоимость обучения в десять раз или более. DMind-1 использует LoRA для SFT. В контролируемых экспериментах статьи-бенчмарка также используется LoRA с рангом 16 и alpha 32.

RLHF и PPO

Обучение с подкреплением на основе обратной связи от людей. Сначала обучают модель вознаграждения на данных человеческих предпочтений (ответ A лучше, чем ответ B на этот вопрос). Затем используют эту модель вознаграждения как обучающий сигнал для оптимизации основной модели с помощью PPO (Proximal Policy Optimization), той же техники, которая используется, чтобы превратить GPT-3 в ChatGPT. Второй этап обучения DMind-1 использует эту пару.

Дистилляция знаний

Небольшая студенческая модель учится у крупной модели-учителя. DMind-1-mini дистиллирована из двух учителей: самой DMind-1 и общей SOTA-модели (запущенной через фреймворк DeepResearch DMind, чтобы согласовать её выходы с контекстами Web3). Дистилляция работает на трёх уровнях. Студент сопоставляет конечные выходы учителя, полное вероятностное распределение учителя по каждому токену и промежуточные представления слоёв.

Два оригинальных метода DMind

HPS (Hierarchical Predictive Synthesis)

Цель обучения, лежащая в основе DMind-3 (21B). HPS учит Оракула рассуждать по слоистой структуре входных данных. Внизу находятся сырые ончейн-события, такие как конкретные транзакции и вызовы контрактов. В середине — агрегированные рыночные индикаторы. Вверху — макросигналы, такие как политика ФРС, CPI и геополитические события.

Для каждой модальности входа модель учится предсказывать следующее глобальное состояние рынка. Функция потерь при обучении объединяет мультимодальное взвешенное логарифмическое правдоподобие с регуляризующим членом, который штрафует слишком сильное отклонение от параметров базовой модели. Регуляризация нужна, чтобы предотвратить катастрофическое забывание, чтобы модель могла специализироваться на финансах, не теряя своих общих языковых способностей.

HPS также даёт Оракулу переключатель инференса с двумя режимами. Стандартный режим возвращает прямой ответ. Специальный [СТРАТЕГИЯ] токен переводит модель в стратегический режим, где она дополнительно учитывает пути рисков и перед ответом извлекает исторически похожие сценарии. Быстрое и медленное мышление, управляемое вызывающей стороной.

C³-SFT (Контрастивное обучение SFT на цепочках исправлений)

Метод обучения, лежащий в основе DMind-3-Mini (4B). C³-SFT построен вокруг одной проблемы. Небольшая модель, уверенно утверждающая неверное, опаснее модели, которая признаёт неопределённость.

Обычное SFT обучает модель выдавать правильный ответ на заданный вопрос. C³-SFT преобразует обучающие данные в четырёхшаговые цепочки. Цепочка начинается с вопроса, затем идёт первоначальный ответ, который кажется правдоподобным, но содержит ошибку, затем явная критика, указывающая, что упустил первоначальный ответ (например, риск манипуляции Оракулом, который не был учтён), затем исправленный ответ, учитывающий критику.

Модель учится выполнять все четыре шага. На этапе инференса это превращается в поведение самовопроса. Модель даёт первоначальный ответ, критикует сама себя и пересматривает его. «Контрастивная» часть названия происходит от того, что при обучении модели показывают и правильные, и типично неправильные ответы, чтобы она научилась специфической форме сбоев.

Это облегчённая версия подхода к рассуждению System-2, который более крупные модели реализуют с отдельными токенами мышления. Именно прямое внедрение его в модель 4B позволяет Mini работать на устройстве пользователя, сохраняя при этом защитный механизм.

Данные обучения

Данные обучения DMind-1 — это 13 276 экспертно отобранных элементов знаний, дистиллированных из 32,7 ГБ исходных документов Web3 по DeFi, токеномике, управлению, смарт-контрактам, архитектуре Layer-1/2, NFT, DAO и безопасности.

Данные обучения DMind-3 больше и более структурированы:

Источник
Доля
Что это

Институциональные альфа-исследования

35%

Отчёты криптонативных фондов и TradFi, декомпозированные с помощью каузальной модели

Глобальные макроэкономические данные

25%

Временные ряды из FRED, Всемирного банка и МВФ, объединённые с ончейн-индикаторами

Данные кросс-чейн индексов

20%

Полная история транзакций, состояний и логов по основным EVM-цепочкам, Solana и Cosmos

Постмортемы и аудиты

10%

Системные сбои, экономические атаки, взломы протоколов с акцентом на ранние сигналы и пути распространения заражения

Геополитика и регулирование

10%

Глобальные изменения в регулировании, политические предложения и геополитические события, влияющие на цифровые активы

Итого: более 500 000 отобранных документов, а также многотерабайтные структурированные ончейн-данные.

Все обучающие данные проверяются экспертами предметной области, а не собираются автоматически. Критерии отбора опубликованы в карточках моделей и статьях.

Последнее обновление

Это было полезно?