Modelos e LLMs

Cactus põe modelo de 14 MB no centro do debate sobre IA de borda

Needle 2 roda em dispositivos baratos, mas o debate questiona sua competência fora de tarefas restritas.

Reprodução · cactuscompute.com

A Cactus lançou o Needle 2, um modelo de linguagem de 14 MB para controlar dispositivos, chamar ferramentas e extrair dados estruturados. Ele tem 45 milhões de parâmetros em compressão de 2 bits, usa 28 MB de RAM por sessão e alcança 500 tokens por segundo no Raspberry Pi 5. O foco são aparelhos baratos, como celulares de menos de US$200, wearables, robôs pequenos e microcontroladores. A publicação somou 426 pontos e 155 comentários no Hacker News.

O tamanho reduz custo, mas estreita a tarefa

A Cactus não tenta fazer o Needle 2 conversar sobre qualquer assunto. O modelo recebe uma frase, escolhe uma função e preenche seus parâmetros. Para ligar uma luz, por exemplo, ele não precisa conhecer o mundo; precisa associar a intenção do usuário à função correta.

Essa restrição explica por que 45 milhões de parâmetros bastam, segundo a empresa. Um schema define os campos de saída, e uma gramática em nível de byte limita os tokens possíveis. Toda resposta usa um envelope de chamada; quando o modelo recusa uma tarefa, devolve uma chamada vazia.

O desenho também inclui um score de confiança aprendido. O dispositivo pode agir acima de um limite e pedir confirmação ou encaminhar a solicitação para a nuvem abaixo dele. A proposta preserva privacidade, reduz latência e evita custo de nuvem nas tarefas rotineiras.

A Cactus treinou o modelo diretamente em 2 bits, em vez de quantizar pesos depois do treinamento. O processo inclui pesos, ativações e KV cache. Na inferência, o Needle 2 gasta 70 MFLOPs por token, contra 87 de um modelo reduzido ao mesmo número de parâmetros e 164 de um transformer com largura e profundidade equivalentes.

O debate começa quando o modelo sai do roteiro

Os números de hardware impressionam, mas os comentários atacaram a distância entre eficiência e competência. O Needle 2 alcança de 400 a 1.500 tokens por segundo em dispositivos de realidade virtual como Meta Quest 3S e Apple Vision Pro, além de 300 a 700 em celulares Samsung A-Series. Nos benchmarks de chamada de ferramentas e uso de dispositivos móveis, ele alterna vitórias com LFM2.5 230M e Apple Foundation Model, modelos de 5 a 70 vezes maiores.

A demonstração web colocou essa promessa à prova. Tiberium relatou que, ao receber uma consulta sobre o Hacker News, o sistema chamou lock_door para a “front door”, embora o pedido não solicitasse isso. “Eu esperaria que ele pelo menos ignorasse — não chamasse ferramentas — nas consultas que não entende”, escreveu Tiberium. “Parece que ele faz isso, mas não de forma consistente.”

Esse comportamento atinge o mecanismo central do produto: a chamada vazia deveria funcionar como recusa. Se o modelo inventa uma ação, o problema deixa de ser apenas conversacional e passa a envolver segurança física. O risco muda conforme a função controlada.

Nater5000 concordou que modelos desse porte recebem pouca atenção, mas questionou o limite escolhido. “Um binário de 14 MB usando 28 MB de RAM parece pequeno demais e bastante arbitrário”, escreveu. Ele perguntou o que mudaria com modelos de 28 MB, 140 MB ou 1,4 MB. A pergunta expõe uma decisão prática: economizar memória ou comprar mais capacidade com um modelo maior.

Os participantes também apontaram lacunas que a demonstração não resolve. Dofm perguntou como combinar o Needle 2 com speech-to-text, text-to-speech e wake words em um Raspberry Pi 5 sem tela. Arthuqa viu valor no Fine-tuning, enquanto minimaltom pediu testes sobre o efeito de remover camadas e tamanhos de Engrams e questionou a escolha de mHC em vez de attention residuals.

O ponto de convergência é claro: tarefas estreitas favorecem modelos pequenos, mas o sistema precisa recusar o que não entende. O debate deixa em aberto a taxa real de falhas, o ganho de ampliar o modelo e a integração com voz. Quem escolher a arquitetura terá de medir essas variáveis no dispositivo e na função específicos, não apenas comparar megabytes por segundo.

Fontes

Modelos e LLMsHacker News
Como fazemos: nossa equipe monitora diariamente os repositórios de código aberto em maior alta e produz esta cobertura com apoio de modelos de linguagem, sempre a partir de dados verificados na fonte primária — repositório, documentação oficial e ranking público. Os números de estrelas e a posição no ranking refletem o momento da coleta. Entenda o método.