Qwen3.8 converge 18 pontos com GPT-5.5 Pro após injeção de raciocínio
Experimento do pesquisador wsxiaoys insere tokens de pensamento da OpenAI em modelos abertos e expõe pistas de destilação.
Edição: Anderson Gomes
· 3 min de leitura
O pesquisador wsxiaoys publicou no GitHub um método de auditoria que testa se modelos abertos foram treinados com respostas da OpenAI. O experimento injetou o primeiro 1% do raciocínio interno do GPT-5.5 Pro no modelo aberto Qwen3.8 A95B diante de 45 problemas técnicos. Esse empurrão fez as respostas visíveis do Qwen convergirem em 18,18 pontos percentuais com o texto proprietário, revelando forte dependência de dados externos. O resultado importa para equipes de engenharia que colocam pesos abertos em produção sem conhecer a real procedência do treinamento.
Salto em tarefas de exatas expõe dependência direta da OpenAI
O teste v1.1 comparou o comportamento de cada modelo diante de 45 desafios técnicos divididos em três grupos de 15: exatas, temas gerais e quebra-cabeças sintéticos privados. Sem o empurrão externo, o Qwen3.8 registrou 16,79% de sobreposição com o GPT-5.5 Pro nos primeiros 100 tokens gerados. Quando recebeu 1% do pensamento do sistema proprietário, a taxa saltou para 34,97%. A disparidade cresceu nas tarefas de exatas, onde o ganho atingiu 26,99 pontos percentuais. O efeito foi imediato.
A medição repercutiu no Hacker News com 237 pontos e 93 comentários de engenheiros e pesquisadores. O usuário wongarsu detalhou o mecanismo que baseia o teste: "Eles usam isso para encontrar pistas de destilação, rodando um benchmark com um modelo de ponta, recuperando a cadeia de pensamento, pegando o primeiro 1% dessa cadeia e rodando o modelo de código aberto como se aquele fosse o início de seu próprio raciocínio". Ele lembrou que o mesmo método já havia mostrado que o Kimi K3 se aproximava das respostas do Claude 4.8. No novo experimento, o Kimi K3 subiu apenas 4,54 pontos com o prefill da OpenAI, embora já partisse de 31,11% sem ajuda. Já o DeepSeek V4 Flash recuou 1,17 ponto e o Inkling oscilou 0,46 ponto positivo.
O debate técnico questionou a pureza dos dados usados no teste. O usuário 7734128 apontou que o Qwen pode ter absorvido os dados vazados antes da avaliação: "O problema com isso é obviamente que os únicos pensamentos do GPT 5.5 a que temos acesso vêm de pensamento roubado. O Qwen 3.8 0902 foi treinado após a publicação do artigo em 10 de agosto, então ele deveria ter visto esses pensamentos específicos". A data do treino muda a leitura.
Engenheiros debatem envenenamento de dados e limite prático
A hipótese de contaminação deliberada também entrou na discussão entre os desenvolvedores. O usuário c7b levantou dúvidas sobre o uso ingênuo de saídas públicas por empresas asiáticas: "O rastro de raciocínio divulgado publicamente é o primeiro lugar onde eu suspeitaria que algum envenenamento de destilação fosse injetado". Por outro lado, CamperBob2 ironizou o protesto das empresas fechadas contra cópias: "Laboratórios de fronteira não têm autoridade moral aqui". As duas pontas concordam que a sobreposição textual alta comprova transferência direta de pesos ou rastros entre as arquiteturas concorrentes.
Para quem opera sistemas locais no dia a dia, a técnica traz pouca utilidade imediata. O usuário hermitShell resumiu essa frustração operacional: "Como usuário de modelos locais, isso significa que existem 'encantamentos mágicos' que podem aumentar o desempenho de alguns modelos locais?". A injeção de raciocínio funciona apenas em contextos restritos e não substitui aprimoramentos gerais como o uso de bons embeddings. O benefício técnico não generaliza.
Resta a dúvida sobre até onde a indústria aberta depende de rastros proprietários para sustentar seus índices em benchmarks. Se os criadores de modelos fechados começarem a poluir cadeias de pensamento expostas, sistemas treinados sobre esse material herdarão vieses e falhas graves. Quem coloca modelos abertos em produção precisa auditar a base de treino para não importar passivos legais e técnicos de concorrentes. A procedência dos pesos virou risco operacional.
- Modelos e LLMs
- Hacker News

Desvio no chip Apple M3 eleva taxa do Llama de 10 para 24 tokens/s
· 3 min de leitura
DeepSeek lança modelo multimodal de 552 bilhões de parâmetros com licença MIT
Arquitetura comprime cache de memória em quatro vezes e ativa só 8 bilhões de parâmetros na leitura para cortar custo de infraestrutura.
· 3 min de leitura

OpenAI lança ChatGPT para bancos com GPT-6 Astra e dados de mercado
· 3 min de leitura

ClearAI valida teses de agentes e atinge 1.308 estrelas em 24 dias
· 3 min de leitura