Synthetic speech detection in Brazilian Portuguese through accent-related features

Pedro H. L. Leite (PEE/COPPE, UFRJ) · Pedro Benevenuto Valadares (FEEC, UNICAMP) · Luiz W. P. Biscainho (DEL/Poli & PEE/COPPE, UFRJ)

Companion page for the paper accepted at IEEE SLT 2026 (Spoken Language Technology Workshop)

arXiv PDF — IEEE Xplore soon Toolbox (code) BibTeX

TL;DR

Brazilian Portuguese TTS voices speak an accent that belongs to no region, and that inconsistency can separate synthetic from natural speech at 6.09% EER with an entire TTS provider and an entire natural corpus held out.

The three markers — click a realization to hear it

/s/ in coda

pasta

/r/ in coda

porta

/d/, /t/ before /i/

dia · tia

Each clip is a 160 ms window centred on a ZIPA-detected phone spike in an annotated natural recording — the exact unit the paper extracts features from. Click a realization repeatedly to cycle through three different speakers. These are the natural realizations a Brazilian listener places regionally without effort; the claim of the paper is that synthetic voices sit between them.

Acre (AC) — /s/ in coda: not characterised · /r/ in coda: not characterised · /d/, /t/ before /i/: not characterisedAlagoas (AL) — /s/ in coda: not characterised · /r/ in coda: not characterised · /d/, /t/ before /i/: non-palatalized [d]Amazonas (AM) — /s/ in coda: not characterised · /r/ in coda: not characterised · /d/, /t/ before /i/: not characterisedAmapá (AP) — /s/ in coda: not characterised · /r/ in coda: not characterised · /d/, /t/ before /i/: not characterisedBahia (BA) — /s/ in coda: not characterised · /r/ in coda: not characterised · /d/, /t/ before /i/: non-palatalized [d]Ceará (CE) — /s/ in coda: not characterised · /r/ in coda: not characterised · /d/, /t/ before /i/: non-palatalized [d]Distrito Federal (DF) — /s/ in coda: not characterised · /r/ in coda: not characterised · /d/, /t/ before /i/: not characterisedEspírito Santo (ES) — /s/ in coda: not characterised · /r/ in coda: not characterised · /d/, /t/ before /i/: not characterisedGoiás (GO) — /s/ in coda: not characterised · /r/ in coda: caipira [ɻ] · /d/, /t/ before /i/: not characterisedMaranhão (MA) — /s/ in coda: not characterised · /r/ in coda: not characterised · /d/, /t/ before /i/: non-palatalized [d]Minas Gerais (MG) — /s/ in coda: not characterised · /r/ in coda: not characterised · /d/, /t/ before /i/: palatalized [dʒ]Mato Grosso do Sul (MS) — /s/ in coda: not characterised · /r/ in coda: not characterised · /d/, /t/ before /i/: not characterisedMato Grosso (MT) — /s/ in coda: not characterised · /r/ in coda: not characterised · /d/, /t/ before /i/: not characterisedPará (PA) — /s/ in coda: chiado [ʃ] · /r/ in coda: not characterised · /d/, /t/ before /i/: not characterisedParaíba (PB) — /s/ in coda: not characterised · /r/ in coda: not characterised · /d/, /t/ before /i/: non-palatalized [d]Pernambuco (PE) — /s/ in coda: not characterised · /r/ in coda: not characterised · /d/, /t/ before /i/: non-palatalized [d]Piauí (PI) — /s/ in coda: not characterised · /r/ in coda: not characterised · /d/, /t/ before /i/: non-palatalized [d]Paraná (PR) — /s/ in coda: sibilant [s] · /r/ in coda: caipira [ɻ] · /d/, /t/ before /i/: not characterisedRio de Janeiro (RJ) — /s/ in coda: chiado [ʃ] · /r/ in coda: carioca [x] · /d/, /t/ before /i/: palatalized [dʒ]Rio Grande do Norte (RN) — /s/ in coda: not characterised · /r/ in coda: not characterised · /d/, /t/ before /i/: non-palatalized [d]Rondônia (RO) — /s/ in coda: not characterised · /r/ in coda: not characterised · /d/, /t/ before /i/: not characterisedRoraima (RR) — /s/ in coda: not characterised · /r/ in coda: not characterised · /d/, /t/ before /i/: not characterisedRio Grande do Sul (RS) — /s/ in coda: sibilant [s] · /r/ in coda: tap [ɾ] · /d/, /t/ before /i/: not characterisedSanta Catarina (SC) — /s/ in coda: chiado [ʃ] · /r/ in coda: not characterised · /d/, /t/ before /i/: not characterisedSergipe (SE) — /s/ in coda: not characterised · /r/ in coda: not characterised · /d/, /t/ before /i/: non-palatalized [d]São Paulo (SP) — /s/ in coda: sibilant [s] · /r/ in coda: tap in the capital, caipira in the interior · /d/, /t/ before /i/: palatalized [dʒ]Tocantins (TO) — /s/ in coda: not characterised · /r/ in coda: not characterised · /d/, /t/ before /i/: not characterised ACAMAPBACEESGOMAMGMSMTPAPBPEPIPRRJRNRORRRSSCSPTO
chiado [ʃ]sibilant [s]not characterised
carioca [x]tap [ɾ]caipira [ɻ]both documentednot characterised
palatalized [dʒ]non-palatalized [d]not characterised

Non-exhaustive examples of regionalistic realizations. Hover a unit for its full entry, or click it to hear the realization shaded there. A shaded unit means the realization is documented there, not that it is uniform across the unit or absent elsewhere.

Research Questions & Answers

Can accent inconsistency separate synthetic from natural speech without a supervised detector?

Yes. A Kernel Density Estimator fitted only on the 364 natural speakers flags synthetic voices as out-of-distribution, reaching 93.9% AUROC on a transductive t-SNE 2D projection and 74.3% on a deployable inductive Isomap 15D projection (72.1% for PCA 5D). No synthetic sample is seen during fitting.

What exactly differs, and is it interpretable?

Synthetic voices show shifted sibilant realizations at /s/ coda (Cliff’s δ = +0.77), a distorted spectral shape at /r/ coda (δ = +0.66), a narrower and displaced /o/–/ɔ/ vowel space, and more within-utterance realization switching for /r/ coda and /d,t/ palatalization (δ = +0.49 and +0.55 per utterance). The feature distributions and the switching statistics below extend the paper’s Figures 3 and 4.

Are the features useful on consolidated anti-spoofing benchmarks?

On BRSpeech-DF official splits the best configuration reaches 2.00% EER, against 30.67% for the SLS-ECAPA baseline. On FakeBRAccent under speaker-disjoint cross-validation it reaches 8.0 ± 0.8% EER. Under double leave-one-dataset-out, where an entire TTS group and an entire natural corpus are held out simultaneously, the overall EER is 6.09%, and 8.13% for the fully interpretable feature set.

Where does the approach lose ground?

On corpora built entirely from voice cloning. A cloning model follows the accent realizations of its target speaker, which narrows the variability the method relies on and makes accent-based disambiguation harder than for the general-purpose, mixed-identity voices found in commercial TTS defaults. The three markers also do not disambiguate every Brazilian variety on their own.

Data, voices and synthesis recipes

The natural side draws on publicly available Brazilian Portuguese corpora; the download helpers live in the pt-br-accent-toolbox package (tools/download_datasets.py and the per-corpus scripts beside it). The synthetic side was generated with the scripts below, each of which reads the same sentence list and writes 16 kHz mono WAV.

ProviderModelVoicesVoice identifiersSettings
Azure AI Speech
commercial
pt-BR *Neural voices10pt-BR-AntonioNeural, pt-BR-FabioNeural, pt-BR-DonatoNeural, pt-BR-HumbertoNeural, pt-BR-NicolauNeural, pt-BR-FranciscaNeural, pt-BR-BrendaNeural, pt-BR-ElzaNeural, pt-BR-GiovannaNeural, pt-BR-LeticiaNeuralSSML, 16 kHz PCM output
Google Cloud TTS
commercial
pt-BR Neural2 / WaveNet / Standard10pt-BR-Neural2-A, pt-BR-Neural2-C, pt-BR-Wavenet-A, pt-BR-Wavenet-D, pt-BR-Standard-A, pt-BR-Neural2-B, pt-BR-Wavenet-B, pt-BR-Wavenet-C, pt-BR-Wavenet-E, pt-BR-Standard-BLINEAR16, 16 kHz
OpenAI TTS
commercial
tts-1-hd9onyx, echo, fable, ash, nova, shimmer, alloy, coral, sagePCM 24 kHz, resampled to 16 kHz
ElevenLabs
commercial
eleven_multilingual_v21036rVQA1AOIPwpA3Hg1tC, tS45q0QcrDHqHoaWdCDR, CstacWqMhJQlnfLPxRG4, hwnuNyWkl9DjdTFykrN6, YNOujSUmHtgN6anjqXPf, 33B4UnXyTNbgLmdEDh5P, lWq4KDY8znfkV0DrK8Vb, oJebhZNaPllxk6W0LSBA, RGymW84CSmfVugnA5tvA, cyD08lEy76q03ER1jZ7ystability 0.5, similarity_boost 0.75, pcm_16000
F5-TTS pt-BR
open-source
firstpixel/F5-TTS-pt-br2f5_ptbr_male, f5_ptbr_femalezero-shot cloning of two ~8 s Azure reference clips
Qwen3-TTS
open-source
Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice9aiden, dylan, eric, ono_anna, ryan, serena, sohee, uncle_fu, vivianbfloat16, preset voices, resampled to 16 kHz
Piper
open-source
pt_BR voices (rhasspy/piper)4pt_BR-cadu-medium, pt_BR-edresson-low, pt_BR-faber-medium, pt_BR-jeff-mediumONNX, 16 kHz native
Kokoro
open-source
hexgrad/Kokoro-82M3pf_dora, pm_alex, pm_santalang_code 'p', 24 kHz resampled to 16 kHz

57 voices in total, each synthesizing the same 50 sentences. Voice identifiers and model names are parsed directly from the synthesis scripts linked in the provider name, which are the scripts that produced the corpus. Synthesis ran between April and June 2026; commercial providers may since have updated the underlying models.

↓ tts_voices.csv57 voices — provider, source, model, voice identifier and synthesis settings, one row per voice.

API credentials are never stored in these scripts: commercial providers take a --key argument or an environment variable.

Synthesis prompt texts

  1. No total, sete mísseis foram disparados contra o encrave.
  2. Até agora, na televisão, eles já somam quatro ministros.
  3. Os dois times perderam uma chance atrás da outra.
  4. Os médicos ainda não sabem quanto tempo ele deverá ficar no hospital.
  5. Tenho muita vontade de aprender, mas baixo poder aquisitivo.
  6. Apesar disso, continua ligado ao seu país de origem.
  7. Evite correr ao banco para trocar o seu dinheiro.
  8. Em grande fase, é a nova sensação do time.
  9. Respondeu que a sua frase havia sido tirada do contexto.
  10. Na Universidade de Paris Três é só isso que se faz.
  11. A Coréia exporta um bilhão de dólares em móveis por ano.
  12. A polícia apreendeu nos últimos vinte dias, sessenta carros a seu serviço.
  13. Segundo ele, foi apenas um almoço rápido entre amigos.
  14. É muito raro que algum documentário esteja na lista deles.
  15. O novo presidente seria conhecido quatro dias após a votação.
  16. Segundo Almeida, é praticamente impossível controlar o fogo sem ajuda exterior.
  17. A justiça brasileira considerou o fato apenas um crime comum.
  18. A decisão está para ser tomada em fevereiro ou março.
  19. A melhoria da qualidade não interessa só a técnicos ou empresários.
  20. No final era um monte de homens se abraçando e chorando.
  21. A margem de erro é de três pontos percentuais.
  22. Juliana disse que o banco a ser escolhido é surpresa.
  23. O vencedor de cada grupo ganha um ponto extra.
  24. Estava muito calor e não soubemos dosar a energia.
  25. Segundo ele, a cabine não faz parte do edifício.
  26. Esse nosso sintetizador de voz vai ficar uma beleza.
  27. Empresa que serve ao Ministério da Fazenda aluga comitê aos tucanos.
  28. Os grandes bancos estão procurando apoiar as pequenas instituições.
  29. Outro obstáculo às relações afetivas é a competitividade interna.
  30. Sem a retirada, os muçulmanos não compareceram às negociações.
  31. Ele, ainda meio confuso, volta para perto da Constituição.
  32. Itamar pode faltar a Mercosul para ir à posse do presidente colombiano.
  33. Tem lucro de um bilhão de dólares por ano.
  34. Os belgas reclamaram, mas o juiz não deu o pênalti.
  35. O Brasil está perdendo pouco a pouco a sua identidade.
  36. É mais importante saber o que fazem os jogadores no campo.
  37. Comprei um jogo de canetas e fui visitá-lo em sua casa.
  38. Meu tipo inesquecível é o advogado Francisco Rangel Pestana.
  39. Empregado do Parlamento Europeu, ele tinha ligações com a bancada socialista.
  40. As entradas podem ser adquiridas pelo telefone acima.
  41. Aliados do tucano prevêem que essas lideranças ficarão neutras.
  42. Perdemos uma ótima oportunidade de fazer a revisão constitucional.
  43. Trabalhamos exclusivamente com tipos que fogem do padrão tradicional de beleza.
  44. Não há, assim, motivo de temor para o Brasil.
  45. No dia de seu aniversário, Rose não saiu de casa.
  46. Somente na última rodada serão definidas as colocações das equipes.
  47. Em abril a taxa foi de dois vírgula seis por cento.
  48. Sem falar nos que ainda não acertaram o fornecimento dos motores.
  49. Ser progressista hoje é ligar o pensamento liberal com a social democracia.
  50. São tantas, que você aprende a conviver com elas.
  51. O truque, segundo ele, é aproveitar bem a madrugada.
  52. Havia possibilidade de uma nova reunião ser convocada para hoje.
  53. Os sobreviventes cremaram seus mortos e procuram reconstruir suas vidas.
  54. As importações de maçã argentina não preocupam os plantadores.
  55. Daqui a pouco, a violência vai ser a única diversão.
  56. Agora, ele despenca do teto em direção ao piso.
  57. A televisão virou um açougue, uma máquina de produzir.
  58. O governo poderá adotar ações penais por crime de omissão de socorro.
  59. Nunca havia ido para um treino com seguranças no ônibus.
  60. Eles experimentaram vários tipos de comidas exóticas durante a viagem.
  61. Apenas dez por cento dos funcionários em todo Brasil trabalharam ontem.
  62. Basta que sua remuneração não seja menor que setenta reais.
  63. Isso traria efeitos sobre os financiamentos habitacionais feitos com recursos da poupança.
  64. Esta diferença acabou se refletindo no índice de julho.
  65. Desconfio que não resistirão à nossa aplicada tática de jogo.
  66. O Brasil tem pressa e o governo está pronto para agir.
  67. Todos os dias, das dezessete horas ao último cliente.
  68. Quero estar no grupo e ajudar sempre que necessário.
  69. Venda de veículos no varejo bate novo recorde em maio.
  70. Eu vi apenas dois videoteipes dos amistosos contra Argentina e Alemanha.
  71. Os investidores foram para a Argentina e para a Venezuela.
  72. Para ele, a concorrência é boa para os consumidores.
  73. As pessoas se divertiram tanto que aplaudiram de pé.
  74. A perspectiva continua otimista para o médio e longo prazos.
  75. Existem péssimas edições do livro, por isso, use o da Edição Pensamento.
  76. Ele defende a formulação de um programa mínimo para evitá-la.
  77. Outros produtos também lembrados: feijão, café e derivados de soja.
  78. Eu queria fazer minhas próprias coisas e logo caí na real.
  79. Quatro homens entraram separadamente pela porta principal da agência.
  80. Eu acabo de receber uma crítica muito elogiosa aqui no Canadá.
  81. O seqüestro de bens serviria para garantir o pagamento.
  82. É uma política oportuna e bem conduzida até agora.
  83. Vamos esquecer o passado, vamos pensar no presente e no futuro.
  84. Depois que a Mangueira passar, o suspense dominará a passarela.
  85. No entender do advogado Celso Botelho de Moraes não há inconstitucionalidade.
  86. Primeiro arredondou a idade do percussionista para cinqüenta anos.
  87. O curso é gratuito e tem a duração de seis meses.
  88. O mais desculpável em Itamar são os seus vexames de passarela.
  89. O termo caça-níqueis se aplica exatamente aos dois jogos.
  90. Ela disse que o Alcorão deveria ser revisado cuidadosamente.
  91. O grupo chegou quando os amotinados já tinham saído.
  92. O ministério diz que não foi consultado sobre a transação.
  93. O número de convocados por vaga é de doze candidatos.
  94. Para discutir sobre ecologia e projetos para gerações futuras.
  95. Fiz o que a maioria procurou fazer: evitei provocar marola.
  96. Eu não quero e não vou falar sobre câmbio e juros.
  97. O partido precisaria, de resto, abrir-se para composições políticas.
  98. A mãe de todas as reformas é a reforma política.
  99. A permanecer a atual situação, será o Brasil que não vingará.
  100. Só para o curso de inglês é necessário conhecimento da língua.
↓ synthesis_prompts.csv110 texts — every prompt text, with its length in characters.
The 10 longer texts
  1. Todas as manhãs, antes de sair para o trabalho, eu costumo tomar um café bem forte e ler as notícias mais importantes do dia. As ruas da cidade ficam cheias de carros, ônibus e pessoas apressadas que precisam chegar cedo aos seus compromissos. Os estudantes correm para as escolas, os trabalhadores esperam nos pontos de ônibus, e os vendedores já começam a montar suas barracas nas esquinas. Eu gosto de observar esse movimento constante enquanto caminho pelas calçadas, prestando atenção nos detalhes que muita gente nem percebe. Às vezes encontro velhos amigos pela rua e paramos para conversar sobre as novidades, sobre os planos para o futuro e sobre as dificuldades que enfrentamos todos os dias. Depois sigo o meu caminho, sempre com pressa, mas tentando aproveitar cada instante dessa rotina que, apesar de cansativa, também tem o seu charme particular.
  2. Na semana passada, decidimos finalmente realizar aquela viagem que vínhamos adiando havia tanto tempo por causa do trabalho e das obrigações. Saímos de madrugada, com as malas cheias e o carro abastecido, prontos para enfrentar as longas estradas que cortam o interior do estado. Durante o percurso, passamos por pequenas cidades históricas, paramos para almoçar em restaurantes simples à beira da rodovia e conversamos sobre as lembranças da nossa infância. As paisagens mudavam constantemente: ora montanhas verdes e úmidas, ora planícies secas e douradas sob o sol forte da tarde. Quando chegamos ao nosso destino, já era quase noite, e as luzes da pousada nos receberam com um brilho acolhedor. Cansados mas felizes, jantamos devagar, brindamos à amizade verdadeira e dormimos profundamente, certos de que aqueles dias ficariam para sempre guardados na memória.
  3. Cozinhar para os amigos sempre foi uma das minhas maiores paixões, especialmente nos finais de semana, quando o tempo permite preparar pratos mais elaborados e demorados. Costumo começar separando todos os ingredientes sobre a bancada: os temperos frescos, as carnes, os legumes coloridos e os queijos que comprei na feira pela manhã. Enquanto as panelas fervem no fogão, vou ajustando o sal, provando os molhos e corrigindo os sabores com paciência e atenção. O cheiro que se espalha pela casa atrai todos para a cozinha, e logo começam as conversas animadas sobre comida, viagens e receitas de família. Quando finalmente servimos o jantar, sinto uma satisfação enorme ao ver os pratos vazios e os sorrisos contentes dos convidados. Para mim, não existe presente maior do que reunir as pessoas queridas ao redor de uma mesa farta e bem preparada.
  4. Trabalhar em uma grande empresa exige muita disciplina, organização e capacidade de lidar com pessoas de diferentes personalidades e interesses. Todas as manhãs, antes mesmo de abrir o computador, eu reviso minha lista de tarefas e estabeleço as prioridades do dia para não me perder no meio de tantas reuniões e solicitações. Os colegas costumam aparecer na minha sala com dúvidas urgentes, relatórios pendentes e projetos que precisam ser entregues dentro de prazos cada vez mais apertados. Apesar da pressão constante, procuro manter a calma, responder os e-mails com clareza e tratar todos com respeito e gentileza. No final da tarde, quando o escritório começa a esvaziar, aproveito o silêncio para revisar os documentos importantes e planejar as atividades do dia seguinte. Saio do prédio cansado, mas com a sensação de dever cumprido e de mais um desafio vencido.
  5. O inverno na serra costuma ser rigoroso, com manhãs geladas, neblinas densas e ventos cortantes que descem das montanhas durante a madrugada. As pessoas que moram nessas regiões aprendem desde cedo a respeitar a força da natureza e a se preparar para os dias mais difíceis do ano. Logo após o amanhecer, os moradores acendem as lareiras, vestem casacos pesados e saem para cuidar dos animais e das plantações que resistem ao frio intenso. Os rios descem cristalinos entre as pedras, e as árvores perdem as folhas, deixando os galhos nus contra o céu acinzentado. Quando o sol finalmente aparece, ainda que tímido, todos param para apreciar a beleza tranquila daquela paisagem silenciosa. À noite, reunidos ao redor do fogo, contam histórias antigas e bebem chás quentes, esperando que a primavera chegue logo para aquecer novamente os corações e os campos.
  6. Quando lembro dos meus tempos de escola, sinto uma mistura de saudade e gratidão por tudo o que vivi naqueles anos importantes da minha formação. As salas de aula eram simples, mas os professores dedicados conseguiam despertar em nós a curiosidade e o desejo constante de aprender coisas novas. Eu adorava as aulas de história e de literatura, nas quais discutíamos grandes acontecimentos e líamos textos que ampliavam os nossos horizontes. Nos intervalos, corríamos pelo pátio, dividíamos os lanches e inventávamos brincadeiras que nos faziam rir até perder o fôlego. Havia também os dias de prova, cheios de tensão e nervosismo, quando estudávamos até tarde tentando memorizar todas as matérias. Apesar das dificuldades, aqueles momentos construíram amizades verdadeiras e ensinamentos que carrego comigo até hoje, sempre que preciso enfrentar os desafios da vida adulta com coragem e determinação.
  7. A tecnologia transformou completamente a maneira como vivemos, trabalhamos e nos relacionamos uns com os outros ao longo das últimas décadas. Hoje em dia, carregamos no bolso aparelhos poderosos que nos permitem acessar informações, conversar com pessoas distantes e resolver problemas complexos em questão de segundos. As empresas investem pesado em inteligência artificial, automação e sistemas digitais que prometem facilitar as tarefas mais repetitivas do cotidiano. No entanto, é preciso usar essas ferramentas com responsabilidade e equilíbrio, para não perder o contato verdadeiro com as pessoas e com o mundo real ao nosso redor. Muitos especialistas alertam sobre os perigos do excesso de telas, da dependência constante e da falta de privacidade nas redes sociais. Cabe a cada um de nós encontrar um caminho saudável, aproveitando os benefícios dos avanços modernos sem abrir mão da nossa humanidade e do tempo dedicado a quem amamos.
  8. As festas populares brasileiras representam uma das manifestações culturais mais ricas e diversas de todo o nosso imenso território nacional. Durante o mês de junho, por exemplo, as cidades do interior se enchem de bandeirinhas coloridas, fogueiras acesas e barracas que vendem comidas típicas deliciosas. As pessoas se vestem com roupas caipiras, dançam quadrilha nas praças e celebram juntas as tradições herdadas dos seus antepassados. O som das sanfonas, dos triângulos e das zabumbas ecoa pelas ruas durante noites inteiras de muita alegria e descontração. Crianças correm de um lado para o outro segurando balões, enquanto os adultos conversam, riem e relembram as festas de outros tempos. Esses encontros fortalecem os laços comunitários e mantêm vivas as raízes culturais que definem a identidade do nosso povo, transmitindo de geração em geração os valores, os costumes e as histórias que nos tornam quem somos.
  9. Cuidar da saúde do corpo e da mente tornou-se uma prioridade indispensável para quem deseja viver com qualidade e disposição. Os médicos recomendam praticar exercícios físicos regularmente, manter uma alimentação equilibrada e dormir as horas necessárias para que o organismo se recupere adequadamente. Caminhar ao ar livre pela manhã, por exemplo, ajuda a reduzir o estresse, fortalecer os músculos e melhorar o funcionamento do coração. Além disso, é fundamental beber bastante água, evitar os alimentos industrializados e reservar momentos de descanso ao longo do dia agitado. Muitas pessoas descobrem que pequenas mudanças nos hábitos diários produzem resultados surpreendentes na saúde física e emocional. Reservar um tempo para meditar, ler um bom livro ou simplesmente conversar com os amigos também contribui enormemente para o bem-estar geral. No fim das contas, a verdadeira riqueza está em manter o equilíbrio entre as obrigações e os prazeres da vida.
  10. A família é, sem dúvida, o alicerce mais importante da nossa vida, o porto seguro para onde sempre retornamos nos momentos felizes e difíceis. Desde a infância, aprendemos com os nossos pais os valores fundamentais que nos acompanham por toda a existência: o respeito, a honestidade e a generosidade. Nos finais de semana, costumamos nos reunir na casa dos avós para almoçar, conversar e relembrar as histórias engraçadas que marcaram a nossa trajetória. As crianças brincam no quintal, os adultos trocam notícias e os mais velhos compartilham conselhos preciosos baseados na sabedoria de quem já viveu bastante. Mesmo quando surgem desentendimentos e discussões, o amor verdadeiro sempre fala mais alto e nos mantém unidos diante de qualquer adversidade. Por isso, devemos valorizar cada instante ao lado das pessoas que amamos, pois são essas lembranças que construímos juntos que dão sentido profundo à nossa caminhada.

Experimental setup

Pool composition, front-end settings, feature definitions and model hyperparameters for every experiment in the paper.

Natural speech pool
Speakers (Tables I-II, Fig. 1-3)364 = 210 TAGARELA/Spotify + 92 annotated + 62 BRSpeech-DF bonafide
Speakers (Table V, double LODO)281 = 189 TAGARELA/Spotify + 92 annotated (BRSpeech-DF excluded)
Source corporaCORAA (CORAL, NURC-RE, TED), Mozilla Common Voice, CoLingPB, CML-TTS, NURC-SP, Certas Palavras, CETUC/Alcaim, TAGARELA (Spotify podcasts)
Selection criterionmultiple dialects and multiple recording chains, filtered for sample quality; no sociolinguistic labels used for selection
Synthetic speech pool
Voices57 TTS voices x 50 sentences (39 commercial + 18 open-source)
Text setthe same 50 phonetically balanced sentences for every voice (sentences_50.txt)
Output format16 kHz mono PCM WAV; providers returning another rate are resampled with torchaudio
Cross-dataset benchmarks
BRSpeech-DFofficial train/validation/test splits (Table III)
FakeBRAccentno official split; speaker-disjoint 5-fold CV over 10 seeds, since the same speaker appears in both bonafide and spoof parts (Table IV)
MLAAD (pt subset)16 TTS systems; synthetic only, so training always draws natural speech from the other sources (Table V)
Audio front-end
Sample rate16 kHz mono throughout
Marker localizationZIPA phone recognizer in forced-alignment mode (ONNX CTC, 20 ms frames)
Marker window+/- 80 ms around the detected marker frame; /d,t/ uses a broad window for spectral moments and a narrow +/- 2-frame window for ZIPA probabilities
PhoneticXeusgroup-pooled phone logits at the same marker frames (+/- 2 frames)
Vowel formantsparselmouth Burg, 5 formants, 5000 Hz ceiling, 25 ms window, 50 Hz pre-emphasis, queried at ZIPA vowel spikes
Channel normalization (Table V only)librosa silence trim at top_db=30, RMS normalization to 0.05 with 0.99 peak safety, and cepstral mean normalization of the MFCC block
Feature blocks
ZIPA (46D)6 spectral moments + windowed CTC phone posteriors for each of the three markers
Formants (29D)per-vowel mean F1/F2/F3 for a, E, e, i, O, o, u (21D) + long-term formant mean/SD (6D) + long-term F0 mean/SD (2D)
PhoneticXeusgroup-pooled phone logits at marker positions
Aggregationper-speaker mean over that speaker's clips; missing vowels imputed with the natural-pool column mean
Models and cross-validation
KDE (Table I)Gaussian kernel, bandwidth 2x Scott, OOD threshold at the 5th percentile of the training log-likelihood, 5-fold, seed 42
Dimensionality reductiont-SNE perplexity 40 / 1000 iterations / PCA init (transductive); Isomap 15 neighbours; PCA 5 components; seed 42
Supervised detection (Table II)XGBoost 400 trees, depth 4, lr 0.05, subsample and colsample 0.8; balanced 5-fold CV over 20 seeds; StandardScaler
Cross-dataset (Table V)XGBoost 400 trees, depth 5, lr 0.05, subsample and colsample 0.8, scale_pos_weight, seed 0
Realization classifiers (Fig. 4)XGBoost 300 trees, depth 4, lr 0.05, subsample and colsample 0.9, L2 1.0, seed 0, on [spec6 | ZIPA | PhoneticXeus logits]
MetricEER computed by sweeping the score threshold; accuracy at the EER operating point
↓ experimental_setup.csv29 settings — pool composition, audio front-end, feature blocks, models and cross-validation.

More feature distributions

Marker-localized features

S_zipa_s distribution
S_zipa_s · /s/ coda · δ=+0.77, p=6e-21 · SHAP+RF
R_spec_peak distribution
R_spec_peak · /r/ coda · δ=+0.53, p=1e-10 · SHAP+RF
R_spec_centroid distribution
R_spec_centroid · /r/ coda · δ=+0.66, p=1e-15 · SHAP+RF
S_spec_centroid distribution
S_spec_centroid · /s/ coda · δ=+0.63, p=1e-14 · SHAP+RF
S_zipa_ʂ distribution
S_zipa_ʂ · /s/ coda · δ=-0.60, p=3e-13 · SHAP+RF · log axis
S_zipa_ʒ distribution
S_zipa_ʒ · /s/ coda · δ=+0.51, p=6e-10 · SHAP · log axis
DT_zipa2_t distribution
DT_zipa2_t · /d,t/ palatalization · δ=+0.55, p=2e-11 · SHAP+RF
S_zipa_z distribution
S_zipa_z · /s/ coda · δ=+0.48, p=4e-09 · SHAP · log axis
DT_zipa_t distribution
DT_zipa_t · /d,t/ palatalization · δ=+0.54, p=5e-11 · SHAP+RF
DT_zipa_ʃ distribution
DT_zipa_ʃ · /d,t/ palatalization · δ=+0.60, p=3e-13 · SHAP+RF
R_zipa_ʀ distribution
R_zipa_ʀ · /r/ coda · δ=+0.36, p=1e-05 · SHAP · log axis
S_zipa_f distribution
S_zipa_f · /s/ coda · δ=-0.03, p=7e-01 · SHAP · log axis
S_zipa_ʃ distribution
S_zipa_ʃ · /s/ coda · δ=-0.67, p=2e-16 · RF
DT_zipa_ʒ distribution
DT_zipa_ʒ · /d,t/ palatalization · δ=+0.52, p=3e-10 · RF
DT_zipa2_ʃ distribution
DT_zipa2_ʃ · /d,t/ palatalization · δ=+0.62, p=6e-14 · RF
DT_zipa2_ʒ distribution
DT_zipa2_ʒ · /d,t/ palatalization · δ=+0.52, p=3e-10 · RF

Vowel spaces (F1 × F2, 95% ellipses)

/o/ and /ɔ/ (paired, as in Figure 3) vowel space
/o/ and /ɔ/ (paired, as in Figure 3) · D=0.53, p=1e-06
/e/ and /ɛ/ (paired, as in Figure 3) vowel space
/e/ and /ɛ/ (paired, as in Figure 3) · D=0.48, p=2e-05
/a/ vowel space
/a/ · D=0.56, p=6e-04
/ɛ/ vowel space
/ɛ/ · D=0.58, p=3e-04
/e/ vowel space
/e/ · D=0.48, p=4e-03
/i/ vowel space
/i/ · D=0.89, p=1e-08
/ɔ/ vowel space
/ɔ/ · D=0.50, p=3e-03
/o/ vowel space
/o/ · D=0.86, p=3e-08
/u/ vowel space
/u/ · D=1.02, p=4e-11

Effect size for every feature

Feature Family Natural median Synthetic median Cliff's δ Mann-Whitney p
S_zipa_s zipa 0.2084 0.2958 +0.773 6.2e-21
S_zipa_ʃ zipa 0.08969 0.02114 -0.675 2.5e-16
R_spec_centroid zipa 855.5 1172 +0.661 9.9e-16
S_spec_variance zipa 1.884e+06 2.74e+06 +0.634 1.4e-14
S_spec_centroid zipa 2296 3214 +0.633 1.5e-14
DT_zipa2_ʃ zipa 0.01145 0.04069 +0.619 5.5e-14
DT_zipa_ʃ zipa 0.01137 0.04069 +0.602 2.6e-13
S_zipa_ʂ zipa 5.181e-05 1.808e-05 -0.601 3.0e-13
R_spec_variance zipa 3.023e+05 5.513e+05 +0.563 8.0e-12
S_spec_logBR zipa -0.2791 0.1812 +0.561 9.3e-12
MF_i_F3 formant 2790 2904 +0.555 1.6e-11
DT_zipa2_t zipa 0.1426 0.1711 +0.551 2.3e-11
S_spec_peak zipa 1506 2198 +0.543 4.1e-11
DT_zipa_t zipa 0.1428 0.1711 +0.541 5.0e-11
R_spec_peak zipa 613.5 733.9 +0.529 1.3e-10
MF_u_F1 formant 550.2 669.4 +0.529 1.4e-10
DT_zipa2_ʒ zipa 0.01452 0.04539 +0.520 2.8e-10
DT_zipa_ʒ zipa 0.01421 0.04539 +0.517 3.4e-10
MF_i_F2 formant 1922 2047 +0.511 5.3e-10
S_zipa_ʒ zipa 0.001135 0.003197 +0.510 5.9e-10
S_zipa_z zipa 0.001823 0.00323 +0.484 4.1e-09
LTFD_F1m formant 584.7 640.6 +0.468 1.3e-08
MF_i_F1 formant 606.5 734.5 +0.455 3.4e-08
S_spec_skew zipa 1.52 0.9438 -0.435 1.3e-07
S_zipa_ɕ zipa 8.013e-05 2.354e-05 -0.424 2.6e-07

The 25 features with the largest absolute effect size, out of the 75 in the phonological feature space. The complete table is available as a CSV below. These p-values are not corrected for multiple comparisons and the features were chosen by an importance ranking fitted on the same data, so they describe the observed separation rather than test a pre-registered hypothesis.

↓ feature_effect_sizes.csv75 features — natural and synthetic medians, Cliff’s delta and the Mann-Whitney p for every feature, not just the panels above.

Within-utterance switching: classifier accuracy

Figure 4 of the paper measures how often a voice changes its realization of the same marker inside one utterance, using the binary Shannon entropy of the per-utterance mean dialectal probability given by a realization classifier.

Realization-classifier accuracy

Marker Accuracy Chance
S 0.781 0.500
R 0.635 0.333
DT 0.813 0.500
These are held-out numbers: each value is scored under leave-one-dataset-out, so the classifier never sees the source dataset it is evaluated on.

Cross-dataset detection, per held-out group

The paper’s Table V reports a double leave-one-dataset-out protocol: for every pair of one held-out TTS group and one held-out natural corpus, a detector is trained on everything else and evaluated on that pair. This gives 24 synthetic groups (8 curated TTS providers and 16 MLAAD systems) × 7 natural corpora = 168 held-out cells per feature set. The tables below open up the two feature sets reported in the paper.

Feature set Overall EER (%) Curated dataset MLAAD
ECAPA+Formants (221D) 6.09 11.30 3.49
ZIPA+PX+Formants (121D) 8.13 12.13 6.13

The paper’s Table V values: means over the whole cross, weighted by the number of speakers in each held-out natural fold. Because the TAGARELA/Spotify fold carries 189 of the 281 natural speakers, it dominates that average.

By held-out TTS group

Held-out TTS group Source Voices / systems ECAPA+Formants EER (%) ZIPA+PX+Formants EER (%)
azure curated 10 4.95 7.44
elevenlabs curated 10 12.49 11.10
f5 curated 2 22.06 32.03
google curated 10 12.03 15.80
kokoro curated 3 1.07 0.71
openai curated 9 3.79 3.36
piper curated 4 31.40 19.84
qwen3 curated 9 2.61 6.76
Fish-S2-Pro MLAAD 4 0.36 0.00
Hume TADA-3B-ML MLAAD 4 1.07 10.49
LEMAS-TTS MLAAD 4 1.07 0.36
Llasa-1B-Multilingual MLAAD 1 2.49 8.90
MOSS-TTS-1.7B MLAAD 4 0.36 1.07
MOSS-TTS-8B MLAAD 4 0.36 6.05
OmniVoice MLAAD 4 0.36 0.00
OpenAI TTS-1 HD MLAAD 13 2.38 9.28
Qwen3-TTS-12Hz-0.6B-Base MLAAD 5 0.71 0.00
Qwen3-TTS-12Hz-1.7B-Base MLAAD 4 0.36 0.36
VoxCPM2 MLAAD 4 1.07 15.84
Voxtral MLAAD 2 9.25 20.82
Bark MLAAD 1 34.16 24.91
XTTS v1.1 MLAAD 1 0.00 0.00
XTTS v2 MLAAD 1 1.42 0.00
VITS (pt, CV) MLAAD 1 0.36 0.00

Each cell holds out that TTS group entirely — it appears in no training fold — and averages the resulting EER over the seven held-out natural corpora, weighted by their speaker counts. Groups with one or two voices give coarse EERs.

By held-out natural corpus

Held-out natural corpus Speakers ECAPA+Formants: all curated MLAAD ZIPA+PX+Formants: all curated MLAAD
TAGARELA / Spotify (RE + SP) 189 3.61 8.33 1.26 5.84 13.30 2.10
annotated — hashed IDs 43 9.75 17.63 5.81 17.48 9.97 21.24
annotated — NAME_F/M IDs 22 11.51 17.10 8.72 11.11 13.43 9.94
annotated — YouTube-style IDs 15 14.82 16.94 13.75 5.14 3.75 5.83
annotated — numeric IDs 6 15.05 26.39 9.38 11.99 14.17 10.90
annotated — lowercase-name IDs 4 3.54 4.38 3.12 1.04 0.00 1.56
annotated — other 2 14.58 18.75 12.50 16.17 14.38 17.07

Each row holds out that natural corpus entirely; the EER is averaged over all 24 held-out TTS groups (and over the 8 curated / 16 MLAAD subsets). The annotated speakers are grouped by the identifier pattern of their source corpus, following the same split used in the switching experiments; folds with fewer than ten speakers are noisy.

Full grid

ECAPA+Formants held-out EER grid
ECAPA+Formants: every held-out (TTS group, natural corpus) cell.
ZIPA+PX+Formants held-out EER grid
ZIPA+PX+Formants: the fully interpretable feature set.

Citation

@inproceedings{leite2026synthetic,
  title     = {Synthetic speech detection in {B}razilian {P}ortuguese through accent-related features},
  author    = {Leite, Pedro H. L. and Valadares, Pedro Benevenuto and Biscainho, Luiz W. P.},
  booktitle = {Proc. IEEE Spoken Language Technology Workshop (SLT)},
  year      = {2026}
}