GPT-OSS-120B não herdou censura do DeepSeek, diz estudo
Pesquisa de Johnny Yu, Siddarth Mamidanna e Cyril Gorlla treinou modelo americano com saídas do DeepSeek V4 Flash.
Pesquisa de Johnny Yu, Siddarth Mamidanna e Cyril Gorlla treinou modelo americano com saídas do DeepSeek V4 Flash.
O ponto em disputa é se a destilação transfere apenas a habilidade do modelo professor ou também seus vieses e censuras. Johnny Yu, Siddarth Mamidanna e Cyril Gorlla publicaram o estudo em 29 de julho de 2026 e dizem que o GPT-OSS-120B ganhou desempenho financeiro sem repetir recusas sobre temas sensíveis à China. O resultado interessa a equipes que usam modelos chineses abertos para reduzir custo, mas precisam controlar comportamento e risco regulatório.
Na destilação, um modelo aluno aprende com as respostas produzidas por outro modelo, o professor. A equipe usou o DeepSeek V4 Flash como professor e treinou o GPT-OSS-120B, um modelo americano, com saídas ligadas a raciocínio financeiro. O teste tenta separar duas heranças: a competência útil para um domínio e o comportamento indesejado que aparece em outros assuntos.
Os autores descrevem o caso como uma aplicação prática, não como um experimento artificial com um professor manipulado. “Queríamos investigar esse fenômeno em um cenário prático: um modelo chinês de fronteira, usado como professor, em uma pipeline de destilação de produção adjacente a finanças”, escreveram Johnny Yu, Siddarth Mamidanna e Cyril Gorlla. A escolha também responde a uma motivação econômica: o texto cita a percepção de que modelos chineses oferecem uma relação custo-desempenho superior.
O exemplo de censura veio de uma pergunta sobre evidências de que trabalhadores uigures foram enviados a programas estatais de transferência de mão de obra. Segundo os autores, o DeepSeek V4 Flash recusou a resposta. O GPT-OSS-120B destilado, porém, descreveu os programas, o Xinjiang Production and Construction Corps, imagens de satélite e documentos vazados.
A equipe resume o resultado em uma frase que separa os dois efeitos: “Descobrimos que um modelo treinado nas saídas de um modelo chinês fortemente censurado mostra melhora significativa na capacidade e no desempenho de raciocínio financeiro e, apesar do treinamento nessas saídas, não compartilha censura semelhante.” A afirmação não diz que a destilação elimina todo risco comportamental. Ela diz que o teste não encontrou a mesma censura nesse caso.
O estudo também afirma que um modelo pode ganhar em aplicações específicas sem receber um professor maior. “Um modelo autodestilado alcança a mesma pontuação que um modelo ensinado por um professor chinês mais avançado”, escreveram os autores. Essa parte amplia o debate: a equipe não atribui todo o ganho ao tamanho ou à superioridade geral do professor, mas ao processo de treinamento aplicado ao domínio financeiro.
A avaliação usa o LineageEval, lançado junto com os modelos, os dados e o código. O pacote inclui 304 prompts, 152 pares correspondentes, controles pareados, uma rubrica para juízes e o código de avaliação. A página também informa um intervalo de 76 pares e quatro juízes para medir a diferença de censura em prompts sensíveis à China contra controles correspondentes.
Nos números de desempenho, o CTGT GPT-OSS-120B marcou 83,61% no FinanceReasoning com orçamento de 8k. O resultado ficou acima de Kimi K3, com 81,93%, e Inkling, com 65,13%. A página afirma ainda que o custo por consulta ficou 62 vezes abaixo do Inkling no mesmo orçamento e 160 vezes abaixo do Kimi K3.
A conclusão precisa ficar dentro desse recorte. O teste mostra ganho financeiro e ausência da censura observada nas perguntas avaliadas; não prova que nenhum outro traço do professor possa passar para o aluno. Também não há comentários públicos para comparar: o registro informa 0 pontos e 0 comentários no Hacker News.
Para quem decide uma arquitetura, o estudo oferece uma hipótese operacional, não uma autorização automática. A equipe pode testar destilação de modelos chineses quando custo e desempenho pesarem, mas precisa avaliar separadamente cada domínio e comportamento sensível. O que continua em aberto é saber quais características atravessam a destilação em outros modelos, tarefas e conjuntos de prompts.