Um LLM em uma GPU de 1 GB: notas do laboratório
Uma parte relevante das máquinas em uso no Brasil tem GPUs que o mercado de IA considera obsoletas. Nossa referência de estudo no surveyor é uma AMD Caicos XT, da arquitetura Terascale 2: 1 GB de VRAM DDR3, OpenCL 1.2 e no máximo 512 MB por buffer.
Nessa classe de hardware, os motores de inferência populares simplesmente não iniciam. O backend OpenCL padrão exige OpenCL C 2.0 ou superior, e a ausência da extensão de meia precisão (cl_khr_fp16) impede a execução direta de tensores FP16 sem emulação.
O relic nasceu para ocupar esse espaço. É um runtime GGUF minimalista para OpenCL 1.2 e 3.0, pensado para orçamentos de 1 a 4 GB de VRAM, GPUs integradas e topologias híbridas que combinam GPU dedicada, GPU integrada e memória do host.
Algumas escolhas definem o projeto. Os buffers de ativação são planejados estaticamente, de modo que não há alocação de memória no caminho crítico da inferência. Os pesos em FP16, Q8_0 e Q4_0 são reempacotados no carregamento para o formato que cada dispositivo processa melhor. Um escalonador decide, tensor a tensor, onde cada dado rende mais por byte transferido.
Em topologias heterogêneas, o relic aplica decodificação especulativa distribuída: um modelo pequeno gera o rascunho em uma GPU, e a outra verifica os tokens em lote. Os kernels e os testes numéricos camada a camada passam hoje em uma NVIDIA GTX 1650 e em uma Intel UHD Graphics.
O próximo passo é um backend de quantização ultrabaixa (2 e 3 bits) para caber em 1 GB de VRAM. Todo o trabalho é aberto e está publicado em github.com/anamnesic.
O que aprendemos aqui chega aos produtos da Chronokairo: modelos que rodam localmente, com privacidade e sem depender de infraestrutura cara.