Verificación previa: validar una config contra el hardware real

Comprometer uno o dos días de cómputo para descubrir en la hora tres que el
lote no entra en memoria, o que fp16 diverge, es el desperdicio más caro del
proyecto. Esto responde en minutos: construye el modelo y el optimizador como
lo haría el entrenamiento y los ejercita con lotes sintéticos del tamaño
configurado, así que no necesita que el corpus exista.

Mide el pico de VRAM reservada (no la asignada: es la reservada la que hace
fallar la asignación), el rendimiento real convertido a horas de reloj, y la
tasa de pasos que el GradScaler descarta por inf/NaN — la señal directa de que
fp16 está perdiendo actualizaciones.

Aparte: .vscode/ sale del repo (config de IDE por máquina) y smoke-2060 fija
run_name, que sin eso los comandos de logs y de descarga pedían nombres
distintos para la misma corrida.

Co-Authored-By: Claude Opus 5 <noreply@anthropic.com>
This commit is contained in:
2026-07-28 00:48:59 -03:00
parent 36040d7cc8
commit 12bdc983e6
4 changed files with 229 additions and 3 deletions
+3
View File
@@ -8,6 +8,9 @@ include:
# El modelo char es diminuto: en la 2060 entra un micro-lote grande sin
# acumulación. Sobrescribe el perfil de la placa solo en lo que corresponde.
train:
run_name: smoke-2060
hardware:
micro_batch_size: 64
grad_accum_steps: 1