Métodos de entrenamiento
Los modelos de DMind combinan dos métodos de entrenamiento originales (HPS y C³-SFT) con métodos estándar como SFT, RLHF, LoRA y destilación. Esta página cubre brevemente cada uno y señala qué modelo usa qué.
Modelos base
DMind-3
21B
gpt-oss-20b
ChatGPT
Motor financiero de estrategia macro para la nube y VPC empresarial, para riesgo sistémico, narrativas entre cadenas, investigación institucional y orquestación de agentes.
DMind-3
4B
Qwen
Modelo local de modelado financiero y razonamiento estratégico. Prioriza la privacidad, está disponible sin conexión y cuenta con razonamiento profundo en el dispositivo.
DMind-3
270M
Gemini
Reconocimiento de intenciones para cartera y DEX en el dispositivo y llamada a funciones. Admite SEARCH_TOKEN y EXECUTE_SWAP, multichain e intenciones en chino e inglés.
DMind-2
107B
GLM-4.5-Air
GLM
Modelo insignia de análisis de inversión en criptomonedas. Cubre tendencias macro a través del comportamiento on-chain, para asesoramiento profesional y análisis institucional.
DMind-2
4B
Qwen3-4B-Thinking-2507
Qwen
Modelo ligero de análisis de inversión en criptomonedas para implementación local y en el borde, con privacidad y baja latencia.
DMind-1
33B
Qwen3-32B
Qwen
Modelo experto en Web3 para DeFi, tokenomics, gobernanza y preguntas y respuestas y razonamiento sobre contratos inteligentes.
DMind-1
15B
Qwen3-14B
Qwen
Versión ligera destilada de DMind-1. Adecuada para preguntas y respuestas en tiempo real de baja latencia, análisis on-chain y agentes ligeros.
Usar los modelos de DMind requiere cumplir tanto con el Acuerdo de Modelo de DMind como con la licencia original del modelo base subyacente.
Métodos estándar
Ajuste fino supervisado (SFT)
El método base. Se emparejan preguntas con respuestas de referencia y se entrena al modelo para que coincida. La primera etapa de entrenamiento de DMind-1 usa SFT.
LoRA (Adaptación de bajo rango)
Una forma eficiente en parámetros de hacer SFT. En lugar de actualizar todos los parámetros del modelo, LoRA añade a cada capa un pequeño par de matrices de bajo rango y solo entrena esas. Esto reduce el costo de entrenamiento en un orden de magnitud o más. DMind-1 usa LoRA para SFT. Los experimentos controlados del artículo de evaluación también usan LoRA con rango 16 y alpha 32.
RLHF y PPO
Aprendizaje por refuerzo a partir de retroalimentación humana. Primero, se entrena un modelo de recompensa con datos de preferencias humanas (la respuesta A es mejor que la respuesta B para esta pregunta). Luego, se usa ese modelo de recompensa como señal de entrenamiento para optimizar el modelo principal con PPO (Optimización de Políticas Proximales), la misma técnica usada para convertir GPT-3 en ChatGPT. La segunda etapa de entrenamiento de DMind-1 usa este par.
Destilación de conocimiento
Un pequeño modelo alumno aprende de un gran modelo profesor. DMind-1-mini se destila a partir de un doble profesor: el propio DMind-1 más un modelo general SOTA (ejecutado a través del marco DeepResearch de DMind para alinear sus salidas con contextos Web3). La destilación funciona en tres niveles. El alumno iguala las salidas finales del profesor, iguala la distribución completa de probabilidades del profesor sobre cada token y alinea las representaciones de capas intermedias.
Los dos métodos originales de DMind
HPS (Síntesis Predictiva Jerárquica)
El objetivo de entrenamiento detrás de DMind-3 (21B). HPS enseña al Oráculo a razonar a través de una estructura en capas de entradas. En la base están los eventos on-chain en bruto, como transacciones específicas y llamadas a contratos. En el nivel medio están los indicadores de mercado agregados. En la parte superior están las señales macro, como la política de la Fed, el IPC y los eventos geopolíticos.
Para cada modalidad de entrada, el modelo aprende a predecir el siguiente estado global del mercado. La pérdida de entrenamiento combina una log-verosimilitud ponderada multimodal con un término de regularización que penaliza alejarse demasiado de los parámetros del modelo base. La regularización está ahí para evitar el olvido catastrófico, de modo que el modelo pueda especializarse en finanzas sin perder su capacidad general de lenguaje.
HPS también le da al Oráculo un alternador de inferencia de dos modos. El modo estándar devuelve una respuesta directa. Un token especial [ESTRATEGIA] cambia el modelo al modo estratégico, donde además considera rutas de riesgo y recupera escenarios históricamente similares antes de responder. Pensamiento rápido y lento, controlado por quien llama.
C³-SFT (SFT de Cadena de Corrección Contrastiva)
El método de entrenamiento detrás de DMind-3-Mini (4B). C³-SFT se construye alrededor de un problema. Un modelo pequeño que afirma con seguridad algo incorrecto es más peligroso que uno que admite incertidumbre.
El SFT estándar entrena a un modelo para producir una respuesta correcta dada una pregunta. C³-SFT transforma los datos de entrenamiento en cadenas de cuatro pasos. La cadena comienza con la pregunta, luego una respuesta inicial que es plausible pero defectuosa, después una crítica explícita que identifica lo que la respuesta inicial omitió (por ejemplo, un riesgo de manipulación del oráculo que no se consideró), y luego una respuesta corregida que aborda la crítica.
El modelo aprende a producir los cuatro pasos. En el momento de la inferencia, esto se convierte en un comportamiento de auto-cuestionamiento. El modelo da una respuesta inicial, se critica a sí mismo y la revisa. La parte "contrastiva" del nombre viene de mostrarle al modelo tanto respuestas correctas como respuestas incorrectas típicas durante el entrenamiento, para que aprenda la forma específica de los modos de fallo.
Esta es una versión ligera del enfoque de razonamiento de Sistema 2 que los modelos más grandes implementan con tokens de pensamiento separados. Integrarlo directamente en un modelo de 4B es lo que permite que Mini se ejecute en el dispositivo del usuario mientras mantiene una red de seguridad.
Datos de entrenamiento
Los datos de entrenamiento de DMind-1 son 13.276 elementos de conocimiento seleccionados por expertos, destilados a partir de 32,7 GB de documentos fuente de Web3 en DeFi, tokenomics, gobernanza, contratos inteligentes, arquitectura Layer-1/2, NFT, DAO y seguridad.
Los datos de entrenamiento de DMind-3 son más grandes y más estructurados:
Investigación institucional de alpha
35%
Informes de fondos nativos de cripto y de TradFi, descompuestos mediante un modelo causal
Datos macroeconómicos globales
25%
Series temporales de FRED, Banco Mundial e FMI, combinadas con indicadores on-chain
Datos de índices entre cadenas
20%
Historial completo de transacciones, estado y logs en las principales cadenas EVM, Solana y Cosmos
Post-mortems y auditorías
10%
Fallos sistémicos, ataques económicos y hackeos de protocolos, con enfoque en señales tempranas y rutas de contagio
Geopolítica y regulación
10%
Cambios regulatorios globales, propuestas de política y eventos geopolíticos que afectan a los activos digitales
Total: más de 500.000 documentos seleccionados, más datos estructurados on-chain de varios terabytes.
Todos los datos de entrenamiento son revisados por expertos del dominio y no recopilados mediante scraping. Los criterios de selección se publican en las fichas del modelo y en los artículos.
Última actualización
¿Te fue útil?

