# Pretraining del modelo base (Etapa 2 del plan). run_name: pretrain-tiny-50m out_dir: runs seed: 1337 # ~3B tokens con lote efectivo 128 x 2048 tokens = 262144 tokens por paso. max_steps: 11500 optimizer: lr: 6.0e-4 beta1: 0.9 beta2: 0.95 eps: 1.0e-8 weight_decay: 0.1 grad_clip: 1.0 # Warmup–Stable–Decay: el LR sube, se mantiene plano la mayor parte de la # corrida, y solo decae en el último ~10%. La fase de decay es también donde # se sube el peso del corpus de estilo (annealing), y es lo que permite # extender esta corrida más adelante sin recalcular el schedule. schedule: kind: wsd warmup_steps: 500 decay_steps: 1150 min_lr_ratio: 0.0 log_every: 10 eval_every: 500 eval_batches: 20 checkpoint_every: 1000 sample_every: 1000