Perplexity lança modelo de 9 bilhões de parâmetros para sistemas RAG
Sob licença MIT, o pplx-embed-v2-context-9b-preview processa fatias com contexto vizinho e gera vetores quantizados em int8 com dimensões Matryoshka.
Edição: Anderson Gomes · texto gerado por IA
· 3 min de leitura
Texto gerado por IA, com revisão automática. Esta matéria foi escrita por um modelo de linguagem a partir da fonte indicada e passou por verificações automáticas de formato, de voz e de título; não houve leitura humana antes da publicação. Como funciona o método · Fonte original: Página do modelo no Hugging Face
A Perplexity publicou em 25 de setembro de 2026 o pplx-embed-v2-context-9b-preview, modelo multilíngue de 9 bilhões de parâmetros que extrai vetores contextuais de fatias de documentos para sistemas RAG. Em vez de avaliar pedaços isolados, o modelo recebe o documento inteiro fatiado em uma lista e processa todos os blocos juntos, fazendo cada vetor reter o contexto ao redor. Esse formato atende engenheiros que perdem precisão quando cortam manuais técnicos ou artigos longos para alimentar bancos vetoriais. A versão ainda é preliminar.
Dois métodos separam a leitura de perguntas e textos
A equipe da Perplexity criou métodos separados de processamento para evitar erros de busca: quem pesquisa na base precisa rodar encode_queries, enquanto quem prepara as fatias do texto usa encode. Passar perguntas pelo método encode derruba a qualidade da recuperação em silêncio, sem disparar alertas no terminal. O modelo adota esse fluxo porque treinou prefixos fixos distintos para textos e perguntas, dispensando comandos extras e aplicando média simples com pooling do tipo Mean. A chamada correta decide a precisão.
Como acontecia no pplx-embed-context-v1, o novo modelo entrega nativamente saídas quantizadas em INT8 sem normalização, o que poupa espaço em disco mas obriga o uso de similaridade de cosseno nas comparações. Caso o desenvolvedor prefira produto escalar nos índices, precisa ativar o parâmetro normalize_embeddings=True para receber dados com norma L2 calculada. A Perplexity aplicou perdas Matryoshka apenas nas larguras de 1024 e 2048 dimensões, permitindo cortar os primeiros 1024 valores antes de normalizar para economizar memória nos bancos de dados. Outros cortes não receberam treino.
Oito arquivos de peso exigem infraestrutura dedicada
A ficha técnica traz a tag pplx_contextual_qwen3_5, que indica a família Qwen 3.5 como base para estruturar os 8 arquivos de peso salvos em formato safetensors. Para carregar esses arquivos em código Python, o usuário precisa instalar transformers>=5.4.0, torch, numpy, safetensors e tqdm, além de passar a opção trust_remote_code=True. As rotinas aceitam processar lotes com batch_size=32, converter tensores em matrizes NumPy com convert_to_numpy=True, mostrar barra com show_progress_bar e enviar cálculos para placas aceleradas pelo parâmetro device. A rotina exige código remoto confiável.
A Perplexity não divulgou a quantidade exata de memória de vídeo necessária para inferência, mas reunir 9 bilhões de parâmetros em 8 arquivos safetensors cria barreiras em máquinas locais de desenvolvimento. Placas gráficas comuns de computadores pessoais raramente conseguem carregar pesos brutos desse porte sem estratégias adicionais de quantização na memória. Quem constrói serviços reais precisará recorrer a instâncias em nuvem ou servidores com aceleradores corporativos para obter respostas rápidas. O hardware define o limite operacional.
A licença MIT autoriza empresas a usar, modificar e redistribuir o modelo em produtos comerciais sem pagar royalties, desde que preservem os créditos originais e o aviso de isenção de responsabilidade. O aviso técnico ressalva que pesos, saídas vetoriais e comandos mudarão em versões futuras sem compatibilidade retroativa, o que impede misturar vetores atuais com lançamentos posteriores. Até o momento, a página oficial na plataforma Hugging Face registra 429 downloads no mês e 51 curtidas desde a publicação, associada à região dos Estados Unidos. Quem adota a prévia assume o risco técnico.
- mit
- feature-extraction
- perplexity-ai
- transformers
- Modelos e LLMs
- HuggingFace Models
GPT-6 Astra preenche planilha fiscal no dobro da velocidade do GPT-5.6
A Basis cortou o tempo de cálculo pela metade e subiu avaliações internas em 20% ao trocar de modelo da OpenAI em rotinas tributárias.
· 3 min de leitura

OpenAI lança agentes Dots com GPT-6 Astra e acesso a 4 mil aplicativos
· 3 min de leitura

Anthropic lança o modelo Sonnet 5.5 e mira ARR de $100B
· 3 min de leitura
OpenAI lança modelos GPT-6 e abre o ChatGPT para agentes autônomos
No DevDay 2026, a empresa fez mais de 20 anúncios, revelou o GPT-6 Astra e abriu ferramentas para programadores criarem recursos para 1.2B usuários semanais.
· 3 min de leitura