# RTX 5090 32 GB — Blackwell, compute capability 12.0. # # Requiere PyTorch >= 2.7 compilado con CUDA 12.8: las versiones anteriores no # conocen sm_120 y fallan al compilar kernels. Antes de usar este perfil hay que # correr el smoke test de la Etapa 0 y verificar el entorno entero. # # Con bfloat16 desaparece el GradScaler: bf16 tiene el mismo rango exponente que # fp32, así que no hay desbordes que escalar. name: blackwell-5090 device: cuda dtype: bfloat16 use_grad_scaler: false attention_backend: flash compile: true matmul_precision: high # 32 GB permiten un micro-lote 4x mayor con la misma acumulación reducida, # manteniendo un lote efectivo comparable (32 * 4 = 128 secuencias) para que # las curvas sean comparables entre placas. micro_batch_size: 32 grad_accum_steps: 4 min_compute_capability: [12, 0] # Aproximado, y solo para la métrica de MFU: bfloat16 denso (sin sparsity). # Verificar con un benchmark real al migrar y ajustar este número. peak_tflops: 209.5