Verificación previa: validar una config contra el hardware real
Comprometer uno o dos días de cómputo para descubrir en la hora tres que el lote no entra en memoria, o que fp16 diverge, es el desperdicio más caro del proyecto. Esto responde en minutos: construye el modelo y el optimizador como lo haría el entrenamiento y los ejercita con lotes sintéticos del tamaño configurado, así que no necesita que el corpus exista. Mide el pico de VRAM reservada (no la asignada: es la reservada la que hace fallar la asignación), el rendimiento real convertido a horas de reloj, y la tasa de pasos que el GradScaler descarta por inf/NaN — la señal directa de que fp16 está perdiendo actualizaciones. Aparte: .vscode/ sale del repo (config de IDE por máquina) y smoke-2060 fija run_name, que sin eso los comandos de logs y de descarga pedían nombres distintos para la misma corrida. Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
This commit is contained in:
@@ -8,6 +8,9 @@ include:
|
||||
|
||||
# El modelo char es diminuto: en la 2060 entra un micro-lote grande sin
|
||||
# acumulación. Sobrescribe el perfil de la placa solo en lo que corresponde.
|
||||
train:
|
||||
run_name: smoke-2060
|
||||
|
||||
hardware:
|
||||
micro_batch_size: 64
|
||||
grad_accum_steps: 1
|
||||
|
||||
Reference in New Issue
Block a user