Blog

0

min de leitura

August 25, 2026

Por que sua taxonomia de feedback perde consistência (e como resolver)

Pat Osorio

Co-founder and CCO of Birdie

Sua taxonomia estava impecável quando entrou no ar. Cada categoria tinha uma definição, alguém era dono dela, e o primeiro mês de relatório fazia sentido para todo mundo que abria. Passou um trimestre. Agora a contagem do seu principal problema não bate com a de março, ninguém mexeu em nada de propósito, e quem pergunta sobre isso na reunião de segunda recebe três respostas diferentes.

É esse o desalinhamento, e uma taxonomia de feedback que perde consistência é a falha mais silenciosa e mais cara em análise de cliente. A estrutura que decide o que conta como o quê é aquilo que todo número seguinte herda. Quando ela segura, seus times discutem prioridade usando os mesmos valores. Quando ela se desalinha, os valores continuam sendo produzidos e silenciosamente param de ser confiáveis, o que é pior do que não ter nenhum, porque o relatório continua com cara de saudável. Isso nunca aparece como mensagem de erro. Aparece como uma métrica que as pessoas param de citar.

Sem uma estrutura governada, o mesmo problema pode ser contado de 5,4 formas diferentes dentro de uma única empresa.

O que é esse desalinhamento, na prática

Não é a sua taxonomia estar errada. Taxonomia errada é fácil: alguém percebe e corrige. Aqui é a sua taxonomia significar outra coisa do que significava no trimestre passado, enquanto os rótulos na tela continuam idênticos. Nada parece quebrado, então nada é corrigido. Na literatura em inglês isso aparece como "drift".

Vem em duas formas. O desvio de definição é a fronteira da categoria se movendo: coisas que ficariam de fora em março entram em setembro, porque quem decidiu traçou a linha em outro lugar. O desvio de estrutura é as categorias se multiplicando, se sobrepondo ou esvaziando, de modo que dois rótulos disputam o mesmo signal e nenhum carrega a contagem inteira. A maioria das empresas tem os dois, e eles se somam, porque categoria sobreposta deixa toda decisão de fronteira mais difícil.

As quatro coisas que causam isso

Não é desleixo. Vem de como as pessoas de verdade falam dos problemas delas.

Como a linguagem do cliente desalinha a taxonomia, e o que isso parece na prática
O que o cliente faz Por que isso desalinha a taxonomia Exemplo
Usa a mesma palavra para coisas diferentes Uma categoria absorve problemas sem relação: a contagem cresce e o significado se dissolve "Loja" pode ser o localizador de lojas, a loja de apps, ou salvar algo
Usa palavras diferentes para a mesma coisa Um problema se divide em várias categorias, e nenhuma fica grande o bastante para ser priorizada Login, entrar, acessar, fazer acesso, não consigo entrar
Descreve partes diferentes da mesma experiência Juntar ou separar essas partes muda de trimestre para trimestre, dependendo de quem classificou Fluxo de esqueci a senha versus querer SSO
Fala coisas novas conforme seu produto muda A estrutura foi desenhada para o produto do trimestre passado e para de servir sem avisar Uma feature entra no ar e o vocabulário em volta muda em semanas

Cada uma dessas é contornável quando uma pessoa só faz a classificação, porque essa pessoa carrega a fronteira na cabeça. Em escala, para de funcionar. Coloque um segundo classificador, ou uma segunda rodada de modelo, e não existe mais uma fronteira: existem várias decisões razoáveis chegando a totais diferentes. É aqui que alguém diz na reunião que "falta um relatório melhor", quando o problema está uma camada abaixo do relatório.

Por que documentar não resolve

A resposta mais comum é um glossário. Escrever as definições, circular, pedir para todo mundo seguir. Ajuda na margem e não estanca o problema, porque glossário descreve intenção e o desalinhamento acontece na aplicação. Fronteira que mora em documento é sustentada por memória, e memória não escala além de um punhado de pessoas.

Classificar com um modelo de uso geral tem a mesma fraqueza em outro lugar. Um prompt não guarda a fronteira, ele a reconstrói em cada rodada. Então a definição é tão estável quanto aquele prompt e aquela versão de modelo, e quando um dos dois muda, a fronteira se move sem nenhum humano decidir que deveria. É por isso que quem monta o próprio pipeline descobre que o mês seis parece ótimo sozinho e não reconcilia mais com o mês um.

Como a Birdie mantém uma taxonomia firme

A Birdie trata a fronteira como dado, não como documentação. Uma taxonomia governada funciona por quatro mecanismos, e vale perguntar por todos os quatro a qualquer fornecedor, não só a este.

  1. Cada tema carrega regras explícitas de SIM e NÃO. Não só o que entra numa categoria, mas o que especificamente não entra. É contra essa fronteira que o classificador é treinado e medido, então ela vive no sistema e não no julgamento de alguém. A documentação de setup da Birdie é direta sobre o retorno: exemplos concretos de SIM e NÃO na definição reduzem bastante o retrabalho na calibração, porque os casos ambíguos são decididos uma vez em vez de toda vez que aparecem.
  2. Cada tema tem o seu classificador e o seu score. Precision e recall são medidos por tema, e não empacotados num número único de acurácia da plataforma. É isso que permite ver que onze das suas categorias estão sólidas e três precisam de trabalho. Um número médio esconde exatamente as categorias que você mais precisa conhecer. Para referência: um classificador treinado no contexto fica em torno de 95 de F-score nessa tarefa, contra cerca de 65 de um modelo de uso geral.
  3. Identidade é separada do rótulo. Cada entidade carrega um código estável que não muda quando ela é renomeada ou recalibrada. Renomeie uma categoria, redesenhe a fronteira dela, reorganize sob outro pai: o histórico continua colado nela. É esse o mecanismo sem glamour que torna um número de setembro comparável a um de março, e é a parte que quase ninguém pergunta numa demo.
  4. Signal não coberto é medido, não escondido. O que estiver dentro de um tema e não corresponder a nenhum problema específico dele cai num grupo separado de não cobertos, e uma fatia baixa ali é indicador de saúde, não detalhe. Isso transforma cobertura num número que você acompanha no tempo, que é como se percebe uma taxonomia perdendo aderência ao produto antes de isso virar uma decisão ruim.

Existe também uma checagem antes de a categoria entrar no sistema. Temas novos são avaliados por atomicidade, por duplicar algo que já existe, por encaixe no pai e por serem específicos o bastante para se distinguir dos irmãos. Pegar uma categoria malformada na criação custa muito menos do que desmontar seis meses de dados classificados contra ela.

Uma última coisa importa para consistência: é a mesma estrutura nos dois lados do negócio. O que o cliente diz corre por Customer Intelligence, e como a linha de frente atende corre por Frontline Intelligence, numa taxonomia só e não em duas. A maioria das empresas avalia comportamento de agente numa ferramenta separada, contra uma régua separada, o que é uma segunda taxonomia que ninguém chama de taxonomia, se desalinhando no ritmo dela.

Nada disso tira as pessoas do circuito, e nem deveria. Seu time define as categorias e revisa a calibração. O sistema mantém essas definições firmes entre as revisões, que é a parte em que humano é pior.

Objeção: nossa taxonomia está boa, o que falta é relatório

Pode ser. O teste custa uma tarde e encerra a discussão nos dois sentidos.

Pegue os três principais problemas do trimestre passado e reconte hoje contra a estrutura atual. Se os números se moveram e ninguém reestruturou nada, é desvio de definição, e nenhum dashboard resolve. Depois peça para duas pessoas classificarem as mesmas 20 conversas, cada uma por conta. Se discordarem em mais de duas, sua fronteira não está escrita com clareza suficiente para ser aplicada igual, o que significa que toda contagem que você tem é uma média de várias definições diferentes.

Se os dois testes voltarem limpos, o problema é de relatório e você deve ir arrumar o relatório. A maioria dos times que roda esses testes não volta limpa.

Veja rodando na sua própria taxonomia

Rode o teste da recontagem primeiro. Se os números se moverem, Agendar demo e traga as três categorias que se moveram mais. Essas são as interessantes.

Começar

Desbloqueie o poder da inteligência de CX com a nossa plataforma de Voz do Cliente e Gestão de Qualidade.

Agendar demo
Stay ahead of what’s next in CX

Get the latest AI and CX news, Birdie insights, and premium resources.

Thanks for submitting the form.

Veja Birdie em ação.

Veja como o Birdie transforma sinais de clientes em decisões de retenção, expansão e adoção. 30 minutos. Demonstração ao vivo com resultados.

Agende uma demonstração