Standard losses and biased activations induce negative weight drift that drives early training dynamics and extreme sparsity across architectures, with squared activations sharply improving accuracy until a cliff near 70% sparsity unless clipping controls intermediate spikes.