For the complete documentation index, see llms.txt. This page is also available as Markdown.

训练方法

DMind 的模型将两种原创训练方法(HPS 和 C³-SFT)与 SFT、RLHF、LoRA 和蒸馏等标准方法结合起来。本页将对每一种方法做简要介绍,并注明各模型使用了哪些方法。

基础模型

系列
参数量
基础
基础提供方
角色

DMind-3

210亿

gpt-oss-20b

ChatGPT

面向云端和企业 VPC 的宏观策略金融引擎,用于系统性风险、跨链叙事、机构研究和智能体编排。

DMind-3

40亿

Qwen3.5-4B

Qwen

本地金融建模与策略推理模型。隐私优先,可离线使用,支持设备端深度推理。

DMind-3

2.7亿

functiongemma-270m-it

Gemini

设备端钱包和 DEX 意图识别及函数调用。支持 SEARCH_TOKEN 和 EXECUTE_SWAP,支持多链,以及中英文意图。

DMind-2

1070亿

GLM-4.5-Air

GLM

旗舰级加密投资分析模型。涵盖从宏观趋势到链上行为,面向专业顾问和机构分析。

DMind-2

40亿

Qwen3-4B-Thinking-2507

Qwen

适用于本地和边缘部署、注重隐私且低延迟的轻量级加密投资分析模型。

DMind-1

330亿

Qwen3-32B

Qwen

面向 Web3 的专家模型,用于 DeFi、代币经济学、治理以及智能合约问答与推理。

DMind-1

150亿

Qwen3-14B

Qwen

DMind-1 的轻量蒸馏版本。适合低延迟实时问答、链上分析和轻量级智能体。

使用 DMind 模型需要同时遵守 DMind 的模型协议和底层基础模型的原始许可证。

标准方法

监督微调(SFT)

基线方法。将问题与参考答案配对,训练模型去匹配。DMind-1 的第一阶段训练使用 SFT。

LoRA(低秩适配)

一种高参数效率的 SFT 方法。与更新模型全部参数不同,LoRA 会在每一层加入一对小的低秩矩阵,并且只训练这些矩阵。这将训练成本降低一个数量级甚至更多。DMind-1 在 SFT 中使用 LoRA。基准论文的受控实验也使用了 rank 16、alpha 32 的 LoRA。

RLHF 和 PPO

基于人类反馈的强化学习。首先,用人类偏好数据训练一个奖励模型(在这个问题上,答案 A 比答案 B 更好)。然后,将该奖励模型作为训练信号,使用 PPO(近端策略优化)来优化主模型,这也是把 GPT-3 变成 ChatGPT 所用的技术。DMind-1 的第二阶段训练使用了这一组合。

知识蒸馏

一个小的学生模型从一个大的教师模型中学习。DMind-1-mini 由双教师蒸馏而来:既包括 DMind-1 本身,也包括一个通用的 SOTA 模型(经由 DMind 的 DeepResearch 框架运行,使其输出对齐到 Web3 场景)。蒸馏在三个层面进行。学生模型匹配教师的最终输出,匹配教师对每个 token 的完整概率分布,并对齐中间层表示。

DMind 的两种原创方法

HPS(分层预测合成)

驱动 DMind-3(210亿)训练目标的方法。HPS 教授 Oracle 在分层结构的输入上进行推理。底层是原始链上事件,如具体交易和合约调用;中层是汇总后的市场指标;顶层是宏观信号,如美联储政策、CPI 和地缘政治事件。

对于每种输入模态,模型学习预测下一个全局市场状态。训练损失结合了多模态加权对数似然和一个正则项,用于惩罚参数偏离基础模型过远。设置该正则项是为了防止灾难性遗忘,使模型在专注金融领域的同时不丢失通用语言能力。

HPS 还为 Oracle 提供了一个双模式推理开关。标准模式返回直接答案。一个特殊的 [STRATEGY] token 会将模型切换到策略模式,在回答前额外考虑风险路径并检索历史相似场景。由调用方控制快思考与慢思考。

C³-SFT(对比式纠错链 SFT)

驱动 DMind-3-Mini(40亿)训练的方法。C³-SFT 围绕一个问题构建:一个自信地说错的小模型,比一个承认不确定性的模型更危险。

标准 SFT 会根据问题训练模型生成正确答案。C³-SFT 将训练数据改造成四步链。链条从问题开始,然后是一个看似合理但有缺陷的初始答案,然后是一个明确的批评,指出初始答案遗漏了什么(例如未考虑到某个预言机操纵风险),最后是一个修正后的答案,回应这条批评。

模型学习生成这四个步骤。在推理时,这会转化为自我质询行为。模型先给出初始答案,再自我批评并修正。名称中的“对比式”来自训练时同时展示正确答案和典型错误答案,从而让模型学习这些失败模式的具体形态。

这是系统 2 推理方法的轻量版本,更大的模型会用独立的思考 token 来实现。将其直接放入 4B 模型,正是 Mini 能在用户设备上运行同时保留安全护栏的原因。

训练数据

DMind-1 的训练数据包含 13,276 条专家精选知识条目,来源于 32.7GB 的 Web3 原始文档,覆盖 DeFi、代币经济学、治理、智能合约、Layer-1/2 架构、NFT、DAO 和安全。

DMind-3 的训练数据规模更大,且结构更清晰:

来源
占比
内容

机构 alpha 研究

35%

加密原生基金和传统金融(TradFi)报告,通过因果模型拆解

全球宏观经济数据

25%

来自 FRED、世界银行、IMF 的时间序列,并与链上指标相结合

跨链指数数据

20%

涵盖主要 EVM 链、Solana、Cosmos 的完整交易、状态和日志历史

事后分析与审计

10%

系统性故障、经济攻击、协议黑客事件,重点关注早期信号和传染路径

地缘政治与监管

10%

影响数字资产的全球监管变化、政策提案、地缘政治事件

总计:50万+ 精选文档,以及数 TB 级链上结构化数据。

所有训练数据均由领域专家审阅,而非抓取而来。筛选标准已在模型卡和论文中公开。

最后更新于

这有帮助吗?