1 2 3 4 5 6 7 8 9 10 11 12
Módulo 7 de 12

Quantização e Hardware

Como fazer a IA caber no seu bolso — chips, compressão de modelos e rodar local.

01001001 01000001 · IA · LLM · GPT · TRANSFORMER · NEURAL · 01010100 01010010

Quantização: Fazendo a IA Caber no Seu Bolso

Um modelo em FP32 (32 bits por número) é preciso, mas enorme. Quantizar é reduzir a precisão dos pesos — como comprimir uma imagem. Você perde um pouco de qualidade, mas ganha MUITO em velocidade e tamanho.

FP32
32 bits
Precisão total. Treinamento. Gigantesco.
FP16 / BF16
16 bits
Padrão para inferência em GPU. Metade do tamanho.
INT8
8 bits
4× menor. Quase sem perda. Roda em CPU.
INT4
4 bits
8× menor. Roda no celular. Pequena perda.
Q2 / Q3
2–3 bits
Extremo. Perda notável. Casos específicos.

📦 GGUF (llama.cpp)

Formato do projeto llama.cpp. Permite rodar LLMs em CPU, celular, Raspberry Pi. Quantizações Q4_K_M, Q5_K_S, etc.

⚡ AWQ

Activation-aware Weight Quantization. Preserva pesos importantes. Muito rápido em GPU NVIDIA.

🎯 GPTQ

Quantização baseada em aproximação de GPT. Clássico para INT4 em GPU.

🔥 ExLlamaV2 / EXL2

Quantização mista por camada. Otimizado para velocidade extrema em GPU.

Exemplo prático: Llama 3 8B em FP16 = 16 GB. Em Q4 = 4.5 GB. Cabe no seu notebook.

Hardware: Onde a IA Acontece

Cada tipo de processador é otimizado para tarefas diferentes. Entender isso explica por que alguns modelos rodam no seu celular e outros precisam de datacenters inteiros.

🖥️

CPU

Central Processing Unit. Poucos núcleos poderosos. Ótima para tarefas gerais, lógica complexa, sistemas operacionais. Lenta para IA, mas universal. Ex: Intel Core, AMD Ryzen, Apple M-series (parte CPU).

🎮

GPU

Graphics Processing Unit. Milhares de núcleos pequenos. Feita para fazer muitas contas simples ao mesmo tempo — exatamente o que redes neurais fazem. Ex: NVIDIA H100, RTX 4090, AMD MI300. É o coração da IA moderna.

🧠

NPU

Neural Processing Unit. Chip dedicado a inferência de IA. Baixo consumo. Presente em celulares modernos (Snapdragon 8 Gen 3, Apple Neural Engine, Intel Core Ultra). Roda modelos quantizados localmente.

TPU

Tensor Processing Unit. Chip do Google, feito sob medida para TensorFlow. Usado em datacenters para treinar e servir Gemini. Gerações: TPU v4, v5p, v6 (Trillium). Extremamente eficiente em matrizes.

🔥 ASIC

Circuitos de aplicação específica. Groq LPU, Cerebras, Graphcore IPU — cada um com uma arquitetura única para IA.

💡 Regra prática

Treinar modelo gigante → GPU/TPU cluster. Rodar no celular → NPU com modelo quantizado. Servir API → GPU datacenter.

🌍 A corrida dos chips

NVIDIA domina o mercado. AMD, Intel, Google, Amazon (Trainium), Microsoft (Maia) e China (Huawei Ascend) correm atrás.