Como usar de-esser na voz sem deixar o áudio abafado

Como usar de-esser na voz depende de três decisões: encontrar a faixa de sibilância, definir quanto reduzir e conferir a fala em frases completas. Como ponto de partida, procure a região entre 4 e 10 kHz e limite a redução a cerca de 2 a 6 dB nos “s”, “ch” e “z”.
O ajuste certo deixa a voz mais confortável sem apagar o brilho das vogais e dos detalhes da dicção. O erro comum é configurar o threshold para agir o tempo todo, transformando uma gravação clara em uma fala opaca.
O que o de-esser deve corrigir na voz
O de-esser é um compressor seletivo. Ele detecta uma faixa aguda da voz e reduz seu volume apenas quando a sibilância passa do limite definido. Sibilância é a energia concentrada em consoantes como “s”, “z”, “ch” e “j”.
A frequência varia conforme a pessoa, o microfone e a distância da captação. Vozes mais graves costumam apresentar excesso entre 4 e 7 kHz. Vozes agudas, microfones brilhantes e gravações feitas muito perto da cápsula podem concentrar o problema entre 7 e 10 kHz.
O de-esser não corrige uma sala muito reflexiva, ruído de boca ou distorção de pré-amplificador. Se a gravação tem estalos, eco ou clipagem, resolva esses problemas antes de tentar controlar os “s”. Para uma captação mais previsível, vale revisar também Como usar microfone shotgun: distância, ganho e direção.
Como encontrar a frequência da sibilância
A busca da frequência vem antes do threshold. Se você comprimir a região errada, a voz perde presença e os “s” continuam agressivos.
-
Coloque o de-esser depois da edição de ruídos e cortes de respiração. Em uma voz ainda sem compressão, fica mais fácil identificar o problema real.
-
Selecione o modo de escuta do detector, quando o plugin oferecer essa função. Reproduza palavras como “sessenta”, “sistema”, “excelência” e “chave”. Procure o ponto em que o som áspero aparece com maior intensidade.
-
Varra a frequência entre 4 e 10 kHz. Evite escolher uma frequência apenas porque ela aparece no analisador de espectro. O analisador mostra energia, mas seus ouvidos decidem se ela incomoda.
-
Desative o modo de escuta do detector e compare a voz inteira. Uma faixa em torno de 6 kHz costuma afetar a inteligibilidade, enquanto uma faixa acima de 8 kHz tende a preservar mais o corpo da fala. Isso muda de gravação para gravação.
Uma etapa que costuma passar despercebida é ajustar o filtro de detecção, e não o volume da voz inteira. Em alguns plugins, o controle aparece como Frequency, Tune, Center ou Detector. O nome muda, mas a função é a mesma: indicar onde o compressor deve procurar a sibilância.
Configuração inicial: frequência, threshold e redução
Use estes valores como ponto de partida para uma locução gravada em 48 kHz, com nível de entrada saudável e sem clipagem:
| Controle | Ponto de partida | O que observar |
|---|---|---|
| Frequência | 5,5 a 8,5 kHz | A faixa em que os “s” ficam ásperos |
| Redução de ganho | 2 a 4 dB | Controle audível sem som apagado |
| Limite máximo | 6 dB | Evita que uma palavra muito forte desapareça |
| Ataque | 0,5 a 3 ms | Captura o início da consoante |
| Release | 40 a 100 ms | Faz o brilho voltar antes da próxima sílaba |
Esses números não são uma receita fixa. Um plugin com detecção ampla pode pedir menos redução do que um modelo que trabalha em uma banda estreita. Faça o ajuste enquanto escuta frases inteiras, porque um “s” isolado costuma levar a uma correção exagerada.
Baixe o threshold até os picos de sibilância acionarem cerca de 2 a 4 dB de redução. Se o medidor ficar reduzindo 2 dB durante vogais, pausas e palavras comuns, o detector está sensível demais ou a frequência está ampla demais.
O release merece atenção. Com tempo muito curto, a voz pode produzir um efeito de bombeamento agudo, como se o brilho piscasse em cada sílaba. Com tempo muito longo, o de-esser continua segurando os agudos depois do “s”, deixando a palavra seguinte sem definição.
Split band ou wideband: qual modo usar?
Os dois modos fazem a redução de forma diferente:
-
Split band: diminui apenas a faixa aguda detectada. Preserva melhor o corpo e o volume geral da voz, mas pode deixar a consoante com uma mudança de timbre perceptível quando a redução é forte.
-
Wideband: reduz a voz inteira durante a sibilância. A transição costuma soar mais natural em correções moderadas, porém a palavra pode perder volume por alguns milissegundos.
Para locução, podcast e vídeo institucional, comece pelo split band se o problema estiver concentrado nos agudos. Teste o wideband quando o “s” continuar saltando para frente ou quando o split band produzir um som metálico.
O modo wideband funciona melhor com redução pequena. Se o medidor chega a 8 ou 10 dB em várias palavras, o problema pode estar na gravação, no posicionamento do microfone ou em um ganho excessivo antes do plugin. Nesse caso, baixar a região entre 6 e 8 kHz com um equalizador dinâmico pode ser mais controlável do que forçar um único de-esser.
Como comparar o áudio antes e depois
A comparação precisa usar o mesmo volume. Um sinal processado mais baixo costuma parecer mais limpo, mesmo quando apenas ficou menos alto.
Faça este teste prático:
-
Separe uma frase com vários “s”, como “A sessão começa às seis e segue sem silêncio”. Use um trecho de 10 a 15 segundos com fala normal e uma palavra enfatizada.
-
Ajuste o de-esser para alcançar 3 dB de redução nos picos. Iguale o volume percebido entre o bypass e o sinal processado.
-
Ouça três vezes: com fones fechados, em monitores e no alto-falante do celular. Fones revelam aspereza residual; o celular mostra se a dicção continua inteligível.
-
Compare palavras com “s” no começo, no meio e no fim. Um ajuste que funciona em “sapo” pode engolir o final de “mais”.
| Situação | Antes | Depois de um ajuste equilibrado |
|---|---|---|
| “Sessenta” | O “s” salta e parece mais alto que a vogal | O “s” continua definido, com menos agressividade |
| “Voz” | O final produz um chiado curto | O “z” fica presente sem chamar atenção |
| “Chave” | O ataque soa áspero e estreito | O “ch” mantém ar e inteligibilidade |
O sinal processado deve continuar parecendo a mesma pessoa no mesmo ambiente. Se a voz fica escura quando você ativa o plugin, reduza a quantidade de ganho removido antes de trocar o microfone, o equalizador ou toda a cadeia.
Onde inserir o de-esser na cadeia vocal
Na maioria das vozes, o de-esser funciona bem depois de uma limpeza básica e antes da compressão principal. A ordem permite controlar os “s” antes que o compressor aumente essas consoantes junto com o restante do sinal.
Uma cadeia inicial pode ser:
edição de ruídos → filtro passa-altas, se necessário → de-esser → compressor → equalizador tonal → limiter
A ordem muda conforme o problema. Se a compressão realça a sibilância, coloque um segundo de-esser depois do compressor com apenas 1 ou 2 dB de redução. Dois ajustes leves costumam preservar mais naturalidade do que um plugin trabalhando com 8 dB de uma vez.
Evite colocar o de-esser antes de corrigir grandes diferenças de volume entre frases. Um “s” em uma palavra muito baixa talvez não acione o detector, enquanto outro em uma frase alta pode ser reduzido demais. Faça clip gain, automação ou compressão leve para aproximar os níveis antes do ajuste final.
Quando há duas pessoas no mesmo projeto, não copie a configuração de uma voz para a outra. Uma interface como a descrita no guia Interface de áudio para dois microfones: guia sem clipar pode registrar microfones com níveis e timbres diferentes. Cada voz precisa de sua própria frequência de detecção.
Como usar de-esser na voz sem deixar a fala abafada
Comece com a menor correção que resolve o incômodo. Se 3 dB de redução já fazem o “s” recuar, aumentar para 6 dB só porque o plugin permite tende a tirar brilho das vogais e da ambiência da gravação.
Use estes sinais para decidir o próximo ajuste:
-
A fala ficou abafada: aumente a frequência de detecção ou reduza o range. O plugin pode estar comprimindo a presença, não apenas a sibilância.
-
Os “s” continuam cortantes: mova a frequência em passos de 500 Hz, confira o threshold e teste wideband com redução menor.
-
A voz pulsa a cada palavra: aumente o release ou diminua a quantidade de redução.
-
O som ficou com “lis” ou “ceceio”: o de-esser está removendo informação demais. Reduza o range e compare os finais de palavras.
-
Só uma ou duas palavras incomodam: use automação ou clip gain nessas palavras antes de aumentar a ação global do plugin.
Em uma gravação feita em uma sala tratada, como uma sessão de voz no Royal Estudio - Localcine, o tratamento acústico não elimina a sibilância criada pelo microfone ou pela dicção. Ele reduz reflexões. Já uma captação em um espaço com superfícies duras pode exigir edição de ambiente antes do processamento vocal. Para projetos que também precisam de imagem, a Galeria Ricardo Von Brusky - Localcine oferece outro tipo de espaço, e a escolha do local muda o trabalho de pós-produção.
Checklist final para uma voz natural
Antes de exportar, confirme estes pontos:
- A redução média fica perto de 2 a 4 dB e só aumenta nos picos mais agressivos.
- O bypass está com volume igual ao sinal processado.
- As palavras com “s”, “z” e “ch” continuam fáceis de entender.
- O release não escurece a sílaba seguinte.
- A voz funciona em fones, monitores e alto-falante pequeno.
- O de-esser não está compensando clipagem, ruído ou diferenças grandes de volume.
A melhor forma de aprender como usar de-esser na voz é salvar duas versões do mesmo trecho: uma com redução moderada e outra com o plugin desligado. Depois de alguns minutos, a configuração correta costuma ser a que você percebe apenas quando compara, não a que muda o timbre inteiro da fala.





