Local Model
O modelo roda na sua máquina. Sem conta de API.
Guia técnico para rodar modelo de linguagem no seu próprio hardware: escolher tamanho, quantizar em GGUF, servir com Ollama ou vLLM e medir tokens por segundo. Em português, para dev e gente de homelab no Brasil.
Tabelas de VRAM por quantização
Quero rodar modelo na minha máquina→Resumo
Local Model é um guia em português para rodar LLM na própria máquina: escolher tamanho pelo hardware, quantizar em GGUF, servir com Ollama ou vLLM e medir tokens por segundo.
Perguntas Frequentes
O que é o Local Model?
Local Model é um projeto brasileiro sobre rodar modelos de linguagem na própria máquina. O recorte é o modelo: como escolher o tamanho certo, quantizar, servir com Ollama ou vLLM e medir tokens por segundo. Conteúdo técnico em português, sem depender de conta de API.
Para quem o Local Model é indicado?
Dev que quer sair da conta de API, gente de homelab com uma GPU sobrando e equipe que não pode mandar dado de cliente pra fora por causa da LGPD. O domínio irmão localagent.com.br trata do agente; aqui o assunto é o modelo em si.
Como escolher o tamanho do modelo pelo hardware que eu tenho?
Comece pela memória disponível, não pelo benchmark. Placa de 8 GB de VRAM roda confortável modelos de 7B ou 8B quantizados em 4 bits; 16 GB abre 13B e 14B; 24 GB alcança 32B apertado. Acima disso, ou você divide entre GPU e CPU, ou aceita ficar lento.
O que é quantização e o que se perde com Q4_K_M?
Quantização reduz a precisão dos pesos, de 16 bits para 8, 5 ou 4, pra o modelo caber em menos memória. No formato GGUF, Q4_K_M é o meio mais usado: encolhe o arquivo perto de quatro vezes contra FP16 e custa alguma perda em raciocínio longo e código. Q8 perde quase nada.
Quanta memória consome um modelo de 7B ou de 70B?
A conta base é bytes por parâmetro: FP16 gasta 2 bytes, Q8 cerca de 1, Q4 na casa de 0,5. Um 7B em Q4 fica na faixa de 4 a 5 GB; em Q8, de 7 a 9 GB. Um 70B em Q4 pede algo entre 40 e 48 GB. Some o KV cache.
Ollama, llama.cpp, vLLM ou LM Studio: quando usar cada um?
llama.cpp é o motor por baixo de boa parte do ecossistema GGUF. Ollama embrulha esse motor numa CLI e num servidor que sobe em minutos. Quem prefere clicar usa LM Studio, que tem interface gráfica. vLLM é outro cenário: GPU dedicada, muitas requisições em paralelo, throughput de produção.
O que é janela de contexto e por que ela come memória?
Janela de contexto é quanto texto o modelo consegue olhar de uma vez, medido em tokens. Cada token processado deixa chaves e valores guardados na memória, o KV cache, e esse custo cresce junto com o contexto. Subir de 4 mil para 32 mil tokens multiplica esse gasto por oito.
Tokens por segundo: o que define essa velocidade?
Na geração, o gargalo raramente é o poder de cálculo. É a largura de banda da memória: pra cada token o hardware precisa ler os pesos inteiros. Por isso GPU com memória rápida ganha de CPU com DDR comum, e por isso quantizar mais agressivo aumenta a velocidade.
GPU, CPU ou Apple Silicon: qual roda melhor?
GPU dedicada é o caminho mais rápido, limitado pela VRAM que você tem. CPU funciona, aceita modelo grande na RAM e entrega poucos tokens por segundo. Mac com Apple Silicon tem memória unificada: a GPU acessa quase toda a RAM, o que permite modelo grande num equipamento silencioso.
Fine-tuning, RAG ou prompt para ensinar meu conteúdo ao modelo?
Prompt primeiro: cabe instrução, formato e exemplo, custo zero. Quando o conteúdo é grande ou muda toda semana, RAG resolve melhor, porque você busca o trecho certo e injeta na hora. Fine-tuning serve pra fixar estilo, formato de saída e vocabulário, não pra decorar fato novo.
Peso aberto é a mesma coisa que open source?
Não. Modelo de peso aberto libera o download do arquivo no Hugging Face, o que não significa licença livre. Llama tem restrição de uso e obrigação de atribuição; Qwen, Mistral e Gemma seguem termos próprios, alguns Apache 2.0, outros não. Leia a licença antes de colocar em produto pago.
O Local Model já está no ar? Quanto vai custar?
O site está em desenvolvimento. Nada de preço fechado ou plano publicado ainda. A ideia é abrir com guias de escolha de modelo, tabela de memória por nível de quantização e medição de tokens por segundo em hardware que dá pra comprar no Brasil. Quem entrar em contato acompanha o começo.
O domínio deste site está à venda?
Está. localmodel.com.br é um domínio exato pra quem publica conteúdo, ferramenta ou serviço de modelo rodando local no mercado brasileiro. Vende junto ou separado do irmão localagent.com.br. Fale com Fabricio Telles em ft.ia.br pra tratar de valor, forma de pagamento e transferência do registro.
"Com software, ou os usuários controlam o programa, ou o programa controla os usuários."