> For the complete documentation index, see [llms.txt](https://minara.ai/docs/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://minara.ai/docs/minara-handbook/ru/tekhnologii/dmind/training-methods.md).

# Методы обучения

Модели DMind сочетают два оригинальных метода обучения (HPS и C³-SFT) со стандартными методами, такими как SFT, RLHF, LoRA и дистилляция. На этой странице кратко рассматривается каждый из них и указано, какая модель что использует.

## Базовые модели

<table><thead><tr><th width="98.546875">Серия</th><th width="96.9140625">Параметры</th><th width="158.96484375">База</th><th width="96.515625">Провайдер базы</th><th>Роль</th></tr></thead><tbody><tr><td>DMind-3</td><td>21B</td><td>gpt-oss-20b</td><td>ChatGPT</td><td>Облачный и корпоративный VPC-движок макростратегии для системного риска, кросс-чейн нарративов, институциональных исследований и оркестрации агентов.</td></tr><tr><td>DMind-3</td><td>4B</td><td><a href="https://huggingface.co/Qwen/Qwen3.5-4B">Qwen3.5-4B</a></td><td>Qwen</td><td>Локальная модель финансового моделирования и стратегического рассуждения. В первую очередь ориентирована на конфиденциальность, доступна офлайн, с глубоким рассуждением на устройстве.</td></tr><tr><td>DMind-3</td><td>270M</td><td><a href="https://huggingface.co/google/functiongemma-270m-it">functiongemma-270m-it</a></td><td>Gemini</td><td>Распознавание намерений кошелька и DEX на устройстве и вызов функций. Поддерживает SEARCH_TOKEN и EXECUTE_SWAP, мультичейн, а также намерения на китайском и английском языках.</td></tr><tr><td>DMind-2</td><td>107B</td><td>GLM-4.5-Air</td><td>GLM</td><td>Флагманская модель анализа криптоинвестиций. Охватывает макротренды через ончейн-поведение, для профессионального консультирования и институционального анализа.</td></tr><tr><td>DMind-2</td><td>4B</td><td>Qwen3-4B-Thinking-2507</td><td>Qwen</td><td>Лёгкая модель анализа криптоинвестиций для локального и пограничного развертывания, конфиденциальности и использования с низкой задержкой.</td></tr><tr><td>DMind-1</td><td>33B</td><td>Qwen3-32B</td><td>Qwen</td><td>Экспертная Web3-модель для DeFi, токеномики, управления и вопросов-ответов и рассуждений по смарт-контрактам.</td></tr><tr><td>DMind-1</td><td>15B</td><td>Qwen3-14B</td><td>Qwen</td><td>Лёгкая дистиллированная версия DMind-1. Подходит для вопросов-ответов в реальном времени с низкой задержкой, ончейн-анализа и лёгких агентов.</td></tr></tbody></table>

Использование моделей DMind требует соблюдения как Соглашения о моделях DMind, так и исходной лицензии базовой модели.

## Стандартные методы

### Обучение с учителем (SFT)

Базовый метод. Сопоставляют вопросы с эталонными ответами и обучают модель им соответствовать. Первый этап обучения DMind-1 использует SFT.

### LoRA (низкоранговая адаптация)

Параметроэффективный способ выполнять SFT. Вместо обновления всех параметров модели LoRA добавляет к каждому слою небольшую пару низкоранговых матриц и обучает только их. Это снижает стоимость обучения в десять раз или более. DMind-1 использует LoRA для SFT. В контролируемых экспериментах статьи-бенчмарка также используется LoRA с рангом 16 и alpha 32.

### RLHF и PPO

Обучение с подкреплением на основе обратной связи от людей. Сначала обучают модель вознаграждения на данных человеческих предпочтений (ответ A лучше, чем ответ B на этот вопрос). Затем используют эту модель вознаграждения как обучающий сигнал для оптимизации основной модели с помощью PPO (Proximal Policy Optimization), той же техники, которая используется, чтобы превратить GPT-3 в ChatGPT. Второй этап обучения DMind-1 использует эту пару.

### Дистилляция знаний

Небольшая студенческая модель учится у крупной модели-учителя. DMind-1-mini дистиллирована из двух учителей: самой DMind-1 и общей SOTA-модели (запущенной через фреймворк DeepResearch DMind, чтобы согласовать её выходы с контекстами Web3). Дистилляция работает на трёх уровнях. Студент сопоставляет конечные выходы учителя, полное вероятностное распределение учителя по каждому токену и промежуточные представления слоёв.

## Два оригинальных метода DMind

### HPS (Hierarchical Predictive Synthesis)

Цель обучения, лежащая в основе DMind-3 (21B). HPS учит Оракула рассуждать по слоистой структуре входных данных. Внизу находятся сырые ончейн-события, такие как конкретные транзакции и вызовы контрактов. В середине — агрегированные рыночные индикаторы. Вверху — макросигналы, такие как политика ФРС, CPI и геополитические события.

Для каждой модальности входа модель учится предсказывать следующее глобальное состояние рынка. Функция потерь при обучении объединяет мультимодальное взвешенное логарифмическое правдоподобие с регуляризующим членом, который штрафует слишком сильное отклонение от параметров базовой модели. Регуляризация нужна, чтобы предотвратить катастрофическое забывание, чтобы модель могла специализироваться на финансах, не теряя своих общих языковых способностей.

HPS также даёт Оракулу переключатель инференса с двумя режимами. Стандартный режим возвращает прямой ответ. Специальный `[СТРАТЕГИЯ]` токен переводит модель в стратегический режим, где она дополнительно учитывает пути рисков и перед ответом извлекает исторически похожие сценарии. Быстрое и медленное мышление, управляемое вызывающей стороной.

### C³-SFT (Контрастивное обучение SFT на цепочках исправлений)

Метод обучения, лежащий в основе DMind-3-Mini (4B). C³-SFT построен вокруг одной проблемы. Небольшая модель, уверенно утверждающая неверное, опаснее модели, которая признаёт неопределённость.

Обычное SFT обучает модель выдавать правильный ответ на заданный вопрос. C³-SFT преобразует обучающие данные в четырёхшаговые цепочки. Цепочка начинается с вопроса, затем идёт первоначальный ответ, который кажется правдоподобным, но содержит ошибку, затем явная критика, указывающая, что упустил первоначальный ответ (например, риск манипуляции Оракулом, который не был учтён), затем исправленный ответ, учитывающий критику.

Модель учится выполнять все четыре шага. На этапе инференса это превращается в поведение самовопроса. Модель даёт первоначальный ответ, критикует сама себя и пересматривает его. «Контрастивная» часть названия происходит от того, что при обучении модели показывают и правильные, и типично неправильные ответы, чтобы она научилась специфической форме сбоев.

Это облегчённая версия подхода к рассуждению System-2, который более крупные модели реализуют с отдельными токенами мышления. Именно прямое внедрение его в модель 4B позволяет Mini работать на устройстве пользователя, сохраняя при этом защитный механизм.

## Данные обучения

Данные обучения DMind-1 — это 13 276 экспертно отобранных элементов знаний, дистиллированных из 32,7 ГБ исходных документов Web3 по DeFi, токеномике, управлению, смарт-контрактам, архитектуре Layer-1/2, NFT, DAO и безопасности.

Данные обучения DMind-3 больше и более структурированы:

| Источник                             | Доля | Что это                                                                                                               |
| ------------------------------------ | ---- | --------------------------------------------------------------------------------------------------------------------- |
| Институциональные альфа-исследования | 35%  | Отчёты криптонативных фондов и TradFi, декомпозированные с помощью каузальной модели                                  |
| Глобальные макроэкономические данные | 25%  | Временные ряды из FRED, Всемирного банка и МВФ, объединённые с ончейн-индикаторами                                    |
| Данные кросс-чейн индексов           | 20%  | Полная история транзакций, состояний и логов по основным EVM-цепочкам, Solana и Cosmos                                |
| Постмортемы и аудиты                 | 10%  | Системные сбои, экономические атаки, взломы протоколов с акцентом на ранние сигналы и пути распространения заражения  |
| Геополитика и регулирование          | 10%  | Глобальные изменения в регулировании, политические предложения и геополитические события, влияющие на цифровые активы |

Итого: более 500 000 отобранных документов, а также многотерабайтные структурированные ончейн-данные.

Все обучающие данные проверяются экспертами предметной области, а не собираются автоматически. Критерии отбора опубликованы в карточках моделей и статьях.


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://minara.ai/docs/minara-handbook/ru/tekhnologii/dmind/training-methods.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
