Novo motor permite rodar modelo de IA de 125 bilhões de parâmetros em PCs comuns
A ferramenta em C++ viabiliza a execução local do Qwen3.8-Flash-Next em computadores domésticos e oferece servidores locais compatíveis com APIs comerciais.
Edição: Anderson Gomes · texto gerado por IA
· 3 min de leitura
Texto gerado por IA, com revisão automática. Esta matéria foi escrita por um modelo de linguagem a partir da fonte indicada e passou por verificações automáticas de formato, de voz e de título; não houve leitura humana antes da publicação. Como funciona o método · Fonte original: Repositório no GitHub
O projeto Strata, criado pelo desenvolvedor Niko1221 na linguagem C++, alcançou a 15ª colocação semanal no ranking Trendshift após registrar 741 novas estrelas em poucos dias. O repositório totaliza 1.230 estrelas e 146 bifurcações de código. A iniciativa resolve a barreira técnica de executar redes neurais de grande porte em computadores pessoais comuns, sem depender de centros de dados em nuvem. Com técnicas de quantização e particionamento, o sistema viabiliza a operação do modelo Qwen3.8-Flash-Next, uma arquitetura de 125 bilhões de parâmetros baseada em mistura de especialistas, chamada Mixture of Experts ou MoE.
Dados rápidos
- Repositório: Niko1221/Strata no GitHub
- Licença: MIT
- Linguagem: C++
- Estrelas e bifurcações: 1.230 estrelas e 146 forks
- Posição no ranking: 15º lugar semanal no Trendshift
- Data da consulta: 29 de setembro de 2026
O problema de infraestrutura para modelos extensos A execução de modelos com mais de cem bilhões de parâmetros costuma exigir servidores corporativos de alto custo financeiro. Usuários que buscam privacidade ou trabalho desconectado esbarram na pouca memória de vídeo dedicada, conhecida como VRAM, presente em placas gráficas domésticas.
A concentração desses sistemas em plataformas remotas impõe filas, latência de rede e dependência contínua de conexão. O motor do Strata contorna essa restrição ao organizar a distribuição dos pesos computacionais entre diferentes componentes físicos, viabilizando o uso de placas comuns NVIDIA GeForce das linhas RTX 30, 40 e 50.
Como funciona a arquitetura e instalação O sistema divide os dados da rede neural em duas partes principais. A primeira parte carrega os blocos especialistas na memória de acesso aleatório, a memória RAM, enquanto as camadas restantes seguem para a placa de vídeo. A segunda parte, composta por uma tabela de consulta de 29 gigabytes, fica armazenada na unidade de estado sólido, o disco SSD, sendo acessada conforme a demanda dos cálculos.
O usuário precisa apenas ter instalado o driver recente da fabricante da placa gráfica e cerca de 80 gigabytes livres em disco. O processo de instalação em sistemas Linux ocorre via terminal com o comando fornecido no projeto:
./setup.sh --setup
No sistema Windows, o usuário executa o arquivo de lote START-HERE.bat, que calibra opções de processamento e pergunta a quantidade de contexto desejada e o suporte visual.
Casos de uso práticos no dia a dia
- Programação assistida com a versão Coder: A variante mantida pelo laboratório ISTA-DASLab descarta metade dos especialistas e funciona com 32 gigabytes de memória RAM. Ela atinge 91 por cento da pontuação do SWE-bench Verified e 99 por cento do LiveCodeBench para gerar código localmente.
- Servidor local compatível com clientes comerciais: O programa disponibiliza endpoints locais que seguem os protocolos das APIs da OpenAI e da Anthropic. Isso permite conectar editores de código e ferramentas externas diretamente ao computador pessoal, sem chaves comerciais externas.
- Leitura de contextos longos de texto: O motor processa documentos em janelas de até 128 mil tokens, que representam unidades textuais de aproximadamente três quartos de palavra. A velocidade atinge entre 41 e 67 tokens por segundo em modelos quantizados, levando 25 segundos para ler 32 mil tokens no formato Q2_0.
- Execução com entrada de imagens: A ferramenta suporta comandos que unem texto e arquivos visuais. Um exemplo prático demonstrado foi a criação de um jardim em blocos tridimensionais do tipo voxel renderizado no navegador web.
Diferenças técnicas frente a outras alternativas Ao contrário de soluções que exigem toda a rede alocada na memória de vídeo da placa gráfica, o motor implementa uma divisão escalonada entre memória RAM, VRAM e disco SSD. Essa engenharia permite que uma placa de 12 gigabytes processe um modelo de 125 bilhões de parâmetros com taxas entre 52 e 90 tokens por segundo em diálogos curtos.
O projeto também oferece suporte experimental para dividir camadas entre duas ou três placas de vídeo. Em testes combinando uma RTX 5080 e uma RTX 3090, essa abordagem em cascata proporcionou leitura de instruções entre 18 e 20 por cento mais rápida do que uma única placa isolada.
Limitações operacionais e cuidados necessários O software apresenta maturidade recente, tendo sido criado em 24 de setembro de 2026, com 55 chamados abertos e versão v0.1.21. A ferramenta restringe seu funcionamento exclusivamente a placas da fabricante NVIDIA.
A utilização de quantizações compactas como Q2_0 pode causar perdas de precisão em raciocínios analíticos elaborados. Embora a aplicação use a licença MIT, modelos integrados como o Swift 1.5 possuem termos próprios. Dados como homepage e tópicos constam como não informado no repositório.
Resumo rápido
- Projeto: Strata (repositório Niko1221/Strata)
- Licença: MIT
- Linguagem: C++
- Estrelas: 1.230 registradas, com 741 no período recente
- Ranking: 15º lugar semanal no Trendshift
- Risco principal: Projeto em estágio inicial com dependência estrita de placas NVIDIA e alto consumo de memória RAM
Fontes
- Repositório no GitHub: https://github.com/Niko1221/Strata
- Última release v0.1.21: https://github.com/Niko1221/Strata/releases
- C++
- MIT
- Repositórios em Alta
- Trendshift
Agentes autônomos recebem conjunto de ferramentas para criar mods em jogos de PC
O repositório universal-modder estrutura a engenharia reversa, geração de mídias e testes para permitir que assistentes de código alterem títulos de PC.
· 5 min de leitura
Ambiente unificado de IA para auto-hospedagem centraliza agentes e modelos locais
A plataforma integra bate-papo, execução de fluxos com agentes autônomos, leitura de e-mails e edição de textos sob controle total do usuário em infraestrutura própria.
· 3 min de leitura
Assistente de código aberto leva o monitoramento de agentes de IA ao entalhe da tela
A ferramenta aberta exibe o progresso de tarefas automatizadas e gerencia autorizações diretamente no topo do display do computador.
· 5 min de leitura
Automação de vídeos curtos em Python ganha tração com fluxo de ponta a ponta
Com versão v1.3.8 e integração a múltiplos modelos, projeto reúne mais de 128 mil estrelas ao automatizar roteiro, voz e edição.
· 3 min de leitura