Transcrição de áudio em Indonésio — grátis no navegador
O VoxScriber Nano entende Indonésio (Bahasa Indonesia) e processa localmente no seu dispositivo. Limite de 10 min no modo gratuito.
Roda o VoxScriber Nano open-source no seu navegador — IA local, até 10 min por arquivo, precisão básica (~85%). Para uso profissional, conheça o Premium.
A transcrição roda no seu navegador (IA local). Você pode optar por compartilhar o resultado conosco (opcional, com consentimento) para nos ajudar a melhorar o serviço. Limite: 10 min por arquivo, precisão ~85%.
Grátis vs Premium — veja a diferença
| Grátis (navegador) | Premium (nuvem) | |
|---|---|---|
| Limite por arquivo | 10 min | 10 horas |
| Precisão | ~85% | >95% |
| Diarização (quem falou) | ❌ | ✅ |
| Timestamps por palavra | ❌ | ✅ |
| Suporte a vídeo (MP4/MOV) | ❌ | ✅ |
| Formatos de export | TXT, SRT, VTT | DOCX, PDF, JSON… |
| Velocidade (1h de áudio) | ~2 min / 1h | ~2 min / 1h |
| Privacidade | 100% local | ☁️ + 🔒 |
IA local
Transcrição feita no seu navegador. Compartilhamento com nossos servidores é opcional (requer consentimento).
Rápido e local
Processamento direto no navegador, sem fila de espera.
99 idiomas
Detecta automaticamente o idioma do áudio.
Sem cadastro
Comece imediatamente, sem criar conta.
Como funciona
Suba ou grave o áudio
Arraste um arquivo MP3, WAV, M4A, OGG ou use o microfone diretamente.
O modelo roda no seu dispositivo
O Whisper AI é baixado uma vez e fica em cache. Sem espera na próxima vez.
Copie ou baixe o texto
Resultado na tela em segundos. Baixe em .txt ou copie com um clique.
Quão bem o Whisper lida com Indonésio?
A fonologia simples do indonésio e o alfabeto latino fazem dele um dos idiomas do sudeste asiático mais confiáveis do Whisper. O indonésio formal é transcrito com alta precisão; a fala coloquial de Jacarta (bahasa gaul) é transcrita como falada. A mistura de javanês ou sudanês reduz a precisão localmente.
De onde o áudio em Indonésio geralmente vem
Notas de voz do WhatsApp — a Indonésia é um dos três principais mercados do WhatsApp — além de palestras universitárias, sermões (ceramah), reuniões de negócios e podcasts.
Quão precisa é a transcrição no navegador?
A transcrição no navegador executa o modelo Whisper da OpenAI diretamente no seu dispositivo usando WebAssembly. Oferecemos três tamanhos de modelo, e a precisão depende de qual você escolher:
- Nano (~40MB) — O padrão. Cerca de 85% de precisão em fala clara. Melhor para anotações rápidas, mensagens de voz e rascunhos. O único modelo que roda no iOS.
- Mini (~150MB) — Aproximadamente 90% de precisão. Um bom meio-termo se seu dispositivo tiver 4 GB ou mais de RAM e você precisar de uma saída mais limpa.
- Plus (~500MB) — A opção local mais precisa, chegando a 93% em áudio limpo. Mais lento para baixar e executar; melhor em máquinas desktop com 8 GB ou mais de RAM.
O que reduz a precisão de qualquer modelo local: ruído de fundo, várias pessoas falando ao mesmo tempo, sotaques carregados e gravações de baixa taxa de bits, como notas de voz compactadas. Se você precisar de precisão profissional acima de 95%, timestamps no nível da palavra ou rótulos de falante, isso exige modelos em nuvem — veja a comparação acima.
Transcrição no navegador vs. nuvem: qual você precisa?
A transcrição no navegador é a ferramenta certa quando a privacidade é mais importante ou o áudio é curto: nada é enviado, não há nada para excluir depois e não custa nada. O trade-off é velocidade e precisão — sua CPU processa aproximadamente uma hora de áudio em vinte minutos, e o modelo local pula identificação de falantes e temporização no nível da palavra.
A transcrição em nuvem é a ferramenta certa quando você está trabalhando: reuniões, entrevistas, palestras, gravações legais. GPUs dedicadas transformam uma hora de áudio em texto em cerca de dois minutos com mais de 95% de precisão, identificam até 30 falantes diferentes, aceitam arquivos de até 10 horas e exportam para DOCX, PDF e JSON além dos formatos de legenda.
Uma regra prática: se você se sentiria confortável lendo a gravação em voz alta em um café, a velocidade e precisão da nuvem vencem. Se o áudio é sensível — uma consulta médica, uma reunião confidencial, uma nota de voz privada — a ferramenta do navegador mantém tudo na sua máquina e ainda oferece uma transcrição utilizável em minutos. Muitos de nossos usuários combinam ambos: anotações privadas rápidas no navegador, trabalho profissional na nuvem.
Ver planos Premium →Formatos de áudio compatíveis
Envie MP3, WAV, M4A, OGG, OPUS, FLAC ou WEBM — qualquer coisa que seu navegador possa decodificar. Fontes comuns funcionam sem problemas: notas de voz do WhatsApp (OPUS), memorandos de voz do iPhone (M4A), arquivos de gravador Android, gravações do Zoom (M4A/MP4), mensagens de voz do Telegram (OGG) e arquivos de podcast (MP3). Contêineres de vídeo como MP4 e MOV são decodificados para sua faixa de áudio quando o navegador suporta o codec. Se um arquivo falhar ao carregar, a causa usual é um codec incomum dentro de um contêiner comum — convertê-lo para MP3 primeiro resolve em quase todos os casos.
Precisa de um formato diferente primeiro? Use nossos conversores gratuitos: conversor de áudio gratuito MP3 / WAV / OGG / AAC
Precisa de mais? Conheça o Premium
Para uso profissional — diarização, áudios longos, análise por IA e exportação em todos os formatos.
Diarização de oradores
Identifica automaticamente quem está falando em cada trecho. Perfeito para reuniões, entrevistas e podcasts.
Áudios de até 10 horas
O modelo local suporta até 10 min. Com Premium, transcreva arquivos de até 10 horas sem limite.
Resumo, sentimento e tópicos
IA analisa o conteúdo e gera resumo executivo, análise de sentimento e extração de tópicos.
Exportação completa
Exporte em SRT, VTT, DOCX, JSON e PDF — ideal para legendas, documentos e automações.
Perguntas frequentes
O áudio é enviado para algum servidor?
A transcrição roda 100% no seu navegador (IA local). Após concluir, você pode optar por compartilhar o áudio e o texto transcrito conosco (checkbox de consentimento) para nos ajudar a melhorar o serviço — mas isso é totalmente opcional e não acontece sem seu consentimento.
Quais formatos de áudio são aceitos?
MP3, WAV, M4A, OGG, FLAC, WEBM, MP4, MOV e qualquer formato que o seu navegador consiga decodificar. Formatos de vídeo são convertidos automaticamente.
Quanto tempo de áudio posso transcrever?
Até 10 minutos por arquivo no modo gratuito. Para áudios maiores, o plano Premium suporta até 10 horas de duração.
Em quais idiomas funciona?
O modelo Whisper suporta 99 idiomas, incluindo português, inglês, espanhol, francês, alemão, japonês, árabe e muito mais. A detecção é automática.
Preciso instalar alguma coisa?
Não. Funciona diretamente no navegador. O modelo de IA (~40MB) é baixado uma vez e fica em cache para as próximas visitas.
A transcrição é salva em algum lugar?
Por padrão, não — o resultado fica apenas no seu navegador. Se você marcar a opção de consentimento, o áudio e o texto são enviados para nossos servidores para fins de melhoria do serviço (e deletados em 7 dias). Você pode negar o consentimento a qualquer momento.
Qual é a diferença para o plano Premium?
O modo gratuito usa o modelo VoxScriber Nano quantizado em 4 bits (q4), que roda localmente com limite de 10 min por arquivo, precisão de ~85%, sem diarização de oradores e timestamps apenas por segmentos de ~30s — não por palavra. O Premium usa modelos em nuvem (AssemblyAI + Whisper Large float32): precisão >95%, diarização de até 30 falantes, timestamps por palavra, arquivos de até 10h, suporte a vídeos MP4/MOV/MKV e exports em DOCX, PDF e JSON. Velocidade: 1h de áudio leva ~20min no seu CPU local vs ~2min no GPU dedicado do Premium.
Funciona no celular?
Sim, mas o desempenho depende do dispositivo. Em smartphones com pouca RAM, a transcrição pode ser mais lenta.
É realmente gratuito?
Sim. O transcritor no navegador é genuinamente gratuito, sem período de teste, sem marca d'água e sem cadastro. Ganhamos dinheiro com os planos Premium na nuvem, não com a ferramenta gratuita.
Meu áudio sai do meu dispositivo?
Não — a transcrição é executada localmente via WebAssembly. A única exceção é se você marcar explicitamente a caixa de consentimento opcional para compartilhar uma gravação conosco.
Há um limite de tamanho de arquivo?
O limite prático é a duração (10 minutos por arquivo) e a memória do seu dispositivo, não megabytes. Um MP3 de 10 minutos normalmente tem 10-20 MB e funciona bem na maioria dos dispositivos.
Quanto tempo leva a transcrição?
Com o modelo Nano, espere aproximadamente 1-2x a duração do áudio em um laptop moderno — um arquivo de 5 minutos leva cerca de 5 a 10 minutos. A primeira execução adiciona um download único do modelo de ~40 MB.
Posso exportar legendas (SRT)?
Sim — exportações gratuitas incluem .txt, .srt e .vtt com timestamps de segmento. Para precisão de timestamp no nível da palavra e exportações em DOCX/PDF/JSON, veja o Premium.
Posso transcrever vários arquivos de uma vez?
Sim — você pode enfileirar até 5 arquivos e eles são processados um após o outro no seu navegador. O Premium remove o limite de fila e processa arquivos em paralelo na nuvem.
Por que a primeira transcrição demora mais?
Na sua primeira visita, o modelo de IA é baixado e compilado pelo seu navegador. Ele é então armazenado em cache, para que todas as transcrições posteriores comecem imediatamente.
Funciona offline?
Parcialmente — uma vez que o modelo está em cache, a transcrição em si não precisa de conexão. Você ainda precisa estar online para carregar a página.
Ele lida com bahasa gaul (gíria)?
Sim — palavras informais como 'gue' e 'nggak' são transcritas como faladas, não normalizadas.
Funciona para javanês ou sudanês?
O Whisper tem suporte limitado para eles; o indonésio oferece resultados muito melhores.
Posso transcrever uma gravação de ceramah ou palestra?
Sim — até 10 minutos por arquivo no modo gratuito; divida gravações mais longas ou use o Premium.
Transcrição gratuita em 20 idiomas
O Whisper suporta 99 idiomas com detecção automática, e mantemos uma página dedicada para cada um dos 20 idiomas mais solicitados, com notas sobre como o modelo lida com esse idioma específico. Escolha o seu abaixo — o transcritor pré-seleciona o idioma correto para melhor precisão.