A Parede de Memória da IA É um Problema de Algoritmo, Não Um Problema de Hardware
Equipes continuam tentando comprar seu caminho através da parede de memória. Mais HBM, clusters maiores, a próxima geração de GPUs. O gasto é real e alívio é temporário, porque a parede não é principalmente um problema de hardware. A maior parte do que parece uma necessidade de memória é um subproduto de escolhas de design preguiçosas, e os algoritmos podem removê-lo.
Os números por trás da parede fazem o caso de por que o hardware sozinho não pode.
A Parede É Real. A Resposta Padrão Está Errada.
O cálculo escala a 3x a cada dois anos. A largura de banda da memória escalou 1,6x nas últimas duas décadas. Essa divergência é a parede de memória e aparece em toda parte na pilha.
Treinar um modelo de 7B precisa de 60–80GB apenas para o estado de treinamento. A solução padrão, checkpointing do gradiente, troca memória por recálculo e lentifica o treinamento em 20–30%. Do lado da inferência, a disparidade é mais gritante. Um A100 precisa de uma intensidade aritmética de cerca de 156 para ser limitado pelo cálculo. Decode roda em torno de 2. Isso é um gap de 80x. Seu caro cálculo fica ocioso, privado pela memória.
A resposta em hardware é mais HBM e a economia é feia. O HBM custa 3x mais por gigabyte do que o DRAM padrão, com preços subindo 20% anualmente. Pagando um prêmio que se compõe anualmente para alimentar chips...

