12bdc983e6
Comprometer uno o dos días de cómputo para descubrir en la hora tres que el lote no entra en memoria, o que fp16 diverge, es el desperdicio más caro del proyecto. Esto responde en minutos: construye el modelo y el optimizador como lo haría el entrenamiento y los ejercita con lotes sintéticos del tamaño configurado, así que no necesita que el corpus exista. Mide el pico de VRAM reservada (no la asignada: es la reservada la que hace fallar la asignación), el rendimiento real convertido a horas de reloj, y la tasa de pasos que el GradScaler descarta por inf/NaN — la señal directa de que fp16 está perdiendo actualizaciones. Aparte: .vscode/ sale del repo (config de IDE por máquina) y smoke-2060 fija run_name, que sin eso los comandos de logs y de descarga pedían nombres distintos para la misma corrida. Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
17 lines
487 B
YAML
17 lines
487 B
YAML
# Smoke test de la Etapa 0 en el servidor con la RTX 2060.
|
|
# Criterio: loss < 1.5 y texto legible en menos de 15 minutos.
|
|
include:
|
|
hardware: hardware/turing-2060.yaml
|
|
model: model/char-smoke.yaml
|
|
train: train/smoke.yaml
|
|
data: data/smoke.yaml
|
|
|
|
# El modelo char es diminuto: en la 2060 entra un micro-lote grande sin
|
|
# acumulación. Sobrescribe el perfil de la placa solo en lo que corresponde.
|
|
train:
|
|
run_name: smoke-2060
|
|
|
|
hardware:
|
|
micro_batch_size: 64
|
|
grad_accum_steps: 1
|