Modelos e LLMs

DeepSeek V4 não transferiu censura ao GPT-OSS, diz CTGT

Teste com 152 prompts indica ganho em finanças sem repetir recusas sobre temas sensíveis da China.

Reprodução · ctgt.ai

O ponto em disputa é se a destilação transfere censura junto com capacidade. A CTGT publicou em 29 de julho de 2026 um teste no qual GPT-OSS-120B aprendeu com DeepSeek V4 Flash, mas manteve o comportamento do modelo-base americano diante de temas políticos chineses. A diferença chegou a 45,45 pontos em um conjunto de prompts pareados. O resultado interessa a empresas que usam modelos chineses como professores sem querer importar suas recusas.

O teste separou habilidade de comportamento

A equipe de Johnny Yu, Siddarth Mamidanna e Cyril Gorlla usou DeepSeek V4 Flash como professor em tarefas financeiras. O GPT-OSS-120B atingiu 83,61% no FinanceReasoning com orçamento de 8 mil tokens, acima de Kimi K3, com 81,93%, e Inkling, com 65,13%. A equipe também publicou pesos abertos de 20B.

O experimento mediu se o aluno absorveria a censura. Os pesquisadores criaram 152 prompts, organizados em 76 pares, com uma pergunta sobre um conceito chinês e outra sobre um equivalente não chinês. Um exemplo compara o Grande Salto Adiante ao Holodomor.

Quatro LLMs deram notas de 0 a 100: Grok 4.20, Gemini 3.5 Flash, GPT-5 mini e Claude Sonnet 4.6. Os julgamentos foram comparados com 96 avaliações humanas e alcançaram correlação r=0,948. A equipe hospedou os próprios pesos porque o OpenRouter bloqueou parte das perguntas.

O professor exibiu uma diferença de 45,45 pontos entre temas sensíveis da China e controles pareados. O texto descreve esse desvio como aproximadamente sete desvios-padrão. Já o modelo destilado respondeu sobre programas de transferência de trabalhadores em Xinjiang, o Xinjiang Production and Construction Corps, imagens de satélite e documentos vazados sem repetir a recusa do DeepSeek V4 Flash.

O resultado também reduziu a importância do tamanho do professor. Segundo a página, um modelo obtido por self-distillation chegou à mesma pontuação de outro ensinado por um modelo chinês mais avançado. No mesmo orçamento, a consulta custou 62 vezes menos que no Inkling e 160 vezes menos que no Kimi K3.

O debate questiona o alcance da conclusão

A discussão no Hacker News registrou 169 pontos e 73 comentários. A página recebeu cinco comentários coletados, com críticas concentradas menos no ganho financeiro e mais na força da alegação sobre transferência de censura.

andy99 perguntou em quais condições surgiria uma forma de aprendizado subliminar: “Se treinássemos a partir de inicializações aleatórias usando as saídas do DeepSeek, sem incluir explicitamente as perguntas políticas, esperaríamos transferência? E se fizéssemos fine-tuning de um modelo pré-treinado em outro lugar usando saídas do DeepSeek? Onde fica o limite?” A pergunta aponta para uma lacuna: o teste mostra o que não aconteceu nesse pipeline, não todas as formas possíveis de transferência.

BoorishBears foi mais duro: “Isso parece um trabalho de distillation moderadamente interessante embrulhado em uma tentativa sem sentido de arrastar a censura para a discussão.” Para esse comentarista, menos de 200 exemplos de SFT não mudariam a forma como o modelo trata o Holodomor, a menos que alguém criasse exemplos de propósito para produzir esse efeito.

seri4l contestou também a escolha do professor: “DeepSeek é, de longe, o mais ‘Western’ dos modelos chineses, então é um pouco perplexo que tenha sido escolhido para testar essa hipótese.” O comentário acrescentou que, depois de contornar o filtro da API, as respostas do DeepSeek V4 sobre conteúdo sensível da China não pareciam diferentes das respostas de Claude e ChatGPT.

Outro leitor relatou uma diferença concreta entre os modelos. reilly3000 escreveu: “A destilação forneceu uma explicação maravilhosamente detalhada sobre o massacre da Praça da Paz Celestial de 1989, enquanto o DS4 respondeu: ‘Sinto muito, não posso responder a esta pergunta porque ela se baseia em eventos históricos sobre os quais não tenho informação.’”

Os lados concordam em um ponto operacional: o pipeline melhorou o raciocínio financeiro, e o comportamento político não apareceu no aluno sob essas condições. O que permanece aberto é se o resultado vale para outros professores, conjuntos de treino, tarefas ou métodos de ajuste. Quem decide usar um modelo chinês como professor pode separar capacidade e filtros no teste, mas ainda precisa auditar o caso específico antes de tratar a ausência de transferência como regra.

Fontes

Modelos e LLMsHacker News
Como fazemos: nossa equipe monitora diariamente os repositórios de código aberto em maior alta e produz esta cobertura com apoio de modelos de linguagem, sempre a partir de dados verificados na fonte primária — repositório, documentação oficial e ranking público. Os números de estrelas e a posição no ranking refletem o momento da coleta. Entenda o método.