# RTX 2060 12 GB — Turing, compute capability 7.5. # # Dos límites de la arquitectura Turing determinan este perfil: # # 1. No soporta bfloat16. Hay que entrenar en float16, que tiene rango # exponente reducido y desborda: por eso use_grad_scaler=true. Los picos # de loss se mitigan además con qk_norm y z_loss en el modelo. # 2. FlashAttention-2 exige Ampere (sm_80) o superior. El backend # mem_efficient de PyTorch sí corre acá y usa memoria O(n) igual. name: turing-2060 device: cuda dtype: float16 use_grad_scaler: true attention_backend: mem_efficient compile: true matmul_precision: high # 12 GB con seq_len 2048 y un modelo de ~50M: micro-lote chico y acumulación # para llegar a un lote efectivo razonable (8 * 16 = 128 secuencias). micro_batch_size: 8 grad_accum_steps: 16 min_compute_capability: [7, 5] # Aproximado, y solo para la métrica de MFU: tensor cores en float16 con # acumulación en float32, que es lo que hace el entrenamiento con AMP. # Sirve para comparar corridas entre sí, no como dato de hardware. peak_tflops: 28.0