Os jovens do futuro talvez não precisem realmente aprender a digitar.

📅 2026-09-04

Resumo:

Nos últimos dias, todos devem ter ficado irritados com a nova função de teste em escala de cinza do WeChat. Primeiro, no modo de entrada de voz, a borda de “pressione e segure para falar” de repente fica espessa e preta, por medo de que você não consiga vê-la. Então, no modo de entrada de texto, a caixa de entrada lembra:

Você pode pressionar e segurar para converter o texto.


O que isso significa?

Antigamente, "Pressione e segure para falar" exigia que você alternasse para o modo de voz antes de poder usá-lo. O que você soltou foi a voz original, e o que foi ouvido do outro lado foi a sua encantadora voz de bolha (a menos que você tenha optado ativamente por convertê-la em texto).


Mas agora, você só precisa manter pressionada a caixa de entrada para falar, e a voz se transformará diretamente em texto e será enviada quando você soltar.


À primeira vista, parece muito conveniente. Você pode enviá-lo diretamente após dizê-lo. No entanto, a primeira reação de muitos internautas é reclamar, e é muito fácil desencadear acidentalmente a morte social.


Mas o mau crítico não está reclamando disso hoje.

Você notou que há muitos lugares para entrada de voz neste aplicativo?

Você deve saber que há algum tempo, o WeChat simplesmente colocava um botão de microfone (+1) no lado direito da caixa de entrada e você podia converter fala em texto com apenas um clique. Além disso, desta vez pressione e segure a caixa de entrada (+1), pressione e segure para falar em modo de voz (+1), bem como a tecla de voz do método de entrada (+1) e o ditado do próprio sistema (+1).

Agora, quando você abre o WeChat, existem 5 portais de voz na metade inferior da tela esperando que você fale.


Guigui, você quer mesmo ouvir o subwoofer do Sr. Bad Review?

Estaria tudo bem se esta situação aparecesse apenas no WeChat no celular. O problema é que muitos aplicativos estão assim agora, desde o celular até o computador.

Por exemplo, a versão desktop do WeChat para Mac tinha o mesmo prompt anterior, solicitando que você pressionasse e segurasse Fn para inserir texto por voz.


Na caixa de entrada da área de trabalho do Feishu, há também uma linha "Mantenha pressionada Fn para falar" para converter fala em texto.


Irmãos, vocês realmente não sabem o quão importante é o Fn no Mac, certo? Todas as teclas de alta frequência no método de entrada e na área funcional estão ocupadas pela sua voz?

Não se preocupe, é para lá que estamos indo.

No documento Feishu, se você abrir uma grade em uma tabela, descobrirá que também há um texto de fala para texto no canto superior direito.


Vamos colocar desta forma: se você abrir qualquer grande aplicativo de fábrica agora, verá um monte de microfones acenando para você: Tio, venha até mim...


Vamos ser razoáveis ​​e fazer uma entrada de voz, ninguém tem objeções, múltiplas escolhas são sempre uma coisa boa.

Mas a postura atual é obviamente mais do que "dar-lhe mais opções":

Alguns usam texto para lembrá-lo, alguns colocam a entrada no local mais visível e alguns simplesmente tornam o botão muito grande.

Parece que os grandes fabricantes fizeram um acordo para priorizar a voz, por medo de não falarmos no app.

Vendo isso, você deve estar curioso para saber por que, qual é a mágica dessa entrada de voz?

No início, o crítico achou que era bastante simples, fácil de usar e barato.

A eficiência de entrada é alta em comparação com Pinyin e o custo não é alto.

De acordo com o preço no site oficial do Volcano Engine, o reconhecimento de voz por streaming do Doubao custa menos de 1 yuan por hora. Mesmo que um usuário frequente envie 10 minutos de discurso todos os dias, isso custa apenas 60 yuans por ano. Este ainda é o preço de varejo e só será mais barato para os grandes fabricantes usarem seus próprios modelos.


Mas o problema é:

A entrada de voz não é nada nova. O Siri consegue ditar há mais de dez anos, e a pesquisa por voz no Amap está disponível há muitos anos. Por que a prioridade da voz é tão alta agora?

Mais tarde, pensei sobre isso e percebi que a chave pode estar no método de entrada.

Já escrevi antes sobre os métodos de entrada dos principais fabricantes, dizendo que o método de entrada é como um guarda de segurança guardando a porta de todos os aplicativos. Ele conhece primeiro todas as suas necessidades e depois o aplicativo.

Por exemplo, se você fizer uma pergunta no aplicativo Doubao, o método de entrada do WeChat pode ter jogado a resposta na sua cara antes de você clicar em enviar.


Da mesma forma, se você enviar uma mensagem no WeChat e digitar usando o método de entrada Beanbao, o WeChat definitivamente não vai querer ver esta cena.

Muitos anos atrás, o método de entrada Sogou ultrapassou o Baidu.

Todos os usuários estão no Baidu, e as palavras candidatas que aparecem durante a digitação são levadas diretamente ao Sogou para pesquisa.


Portanto, os aplicativos devem estar pensando: existe uma maneira de os usuários interagirem diretamente comigo e contornarem a segurança do método de entrada?

Fala para texto.

Na verdade, essa tecnologia existia há muitos anos, mas naquela época o custo era alto e a precisão baixa.

Com o desenvolvimento de modelos de fala em larga escala nos últimos dois anos, sua precisão e velocidade de resposta tornaram-se quase perfeitas.

Pode-se dizer que a voz para texto suportada pela IA dá ao aplicativo a oportunidade de trabalhar sozinho pela primeira vez, sem medo de ser interceptado pelo método de entrada.


Mas isso é apenas "defesa". Vamos olhar um pouco mais longe: os grandes fabricantes estão na verdade na ofensiva, aproveitando antecipadamente a entrada para a próxima geração de interações.

Hoje, se você pressionar e segurar para falar, o aplicativo irá ajudá-lo a converter suas palavras em palavras; amanhã, se você pressionar e segurar para falar, o aplicativo reservará um voo diretamente para você?

Já existem alguns aplicativos nativos de IA que podem fazer isso, mas aplicativos como WeChat e Feishu também querem ir nessa direção, então eles primeiro treinam os usuários para falar e depois treinam os usuários para ter conversas diretas com os agentes para atender às suas necessidades.

Na próxima geração de aplicativos, você deve abrir a boca e falar → a IA fará o trabalho diretamente.

Mas esse processo precisa ser gradual.

Portanto, agora os principais aplicativos devem tentar o seu melhor para orientar e cultivar o hábito dos usuários falarem em seus próprios aplicativos e, em seguida, integrar gradualmente vários resumos de IA e funções de pesquisa em comandos de voz.

É por isso que todo mundo está promovendo o reconhecimento de voz.


Mas este não é o fim.

Esse fenômeno também se espalhará para a maioria dos aplicativos do mercado no futuro.

Porque na era incremental, todos competem com quem consegue correr mais rápido, enquanto na era das ações, todos competem com quem consegue morder mais forte. Quando o bolo já não fica maior, cada família só pode pegar o que está na sua tigela.

Nesta situação, qualquer função que possa ser combinada com IA e tornar os usuários dependentes, desde que a primeira empresa o faça, a segunda empresa o seguirá. Como os usuários são dependentes, a demanda do mercado mudará e, se você não fizer isso, seus usuários serão roubados.

Não acredite em mim, apenas critique a si mesmo. Sou um exemplo vivo de ter sido treinado com sucesso por uma grande empresa.

Quando vi essas entradas de voz pela primeira vez, pensei comigo mesmo: escrevo há mais de dez anos e a velocidade da minha mão não tem sido lenta, então por que deveria falar com meu telefone?

Depois de tentar várias vezes, descobri que o reconhecimento é muito rápido e preciso, e quaisquer ambigüidades podem ser corrigidas automaticamente.

Há alguns meses, eu ainda usava a digitação como padrão e só usava a voz porque estava com preguiça de fazê-lo...

E agora?

Eu nunca digito quando consigo abrir a boca. Mesmo quando estou sentado no escritório escrevendo um manuscrito, quero ditar. Meus dedos não estão mais doloridos e minha velocidade de entrada é mais rápida. Pelo contrário, quando ocasionalmente volto para o método de entrada, me pergunto por que ele é tão cansativo.


É claro que minhas dependências da IA ​​vão muito além disso.

Agora que vejo um artigo longo, não tenho paciência para lê-lo do começo ao fim, então deixo para a IA resumir os pontos principais. Se eu quiser verificar alguma notícia ou vídeo no Twitter, @Grok vai deixar passar; quando normalmente procuro informações, simplesmente leio o resumo da IA ​​e, se for difícil, deixo vários agentes resolverem isso para mim.


Não prestei muita atenção a essas funções quando elas apareceram pela primeira vez, mas depois de experimentá-las algumas vezes, não conseguia viver sem elas, mesmo sem perceber.

Quando você e eu confiamos na IA dessa forma, a demanda do mercado é sutilmente reescrita.

Todos não poderão usar um aplicativo sem voz de IA e resumo de IA. Para se adaptarem ao mercado, os desenvolvedores de aplicativos terão naturalmente que seguir o exemplo para fornecer essas funções.

Talvez em breve o método de entrada não seja mais uma necessidade.

Quando começamos a falar sobre esse assunto, a equipe editorial ainda estava brincando:

Se a entrada de voz continuar assim, os jovens do futuro talvez nem consigam digitar pinyin.

Isso pode parecer um pouco assustador no início, mas quando chegar o dia, não fará diferença se você não conseguir digitar pinyin. Cada geração tem suas próprias habilidades. A geração anterior pensava que não poderíamos consertar lâmpadas ou digitar cinco tempos, mas ainda assim vivíamos uma vida muito boa.

O método de entrada nunca foi o objetivo, é apenas uma forma de conectar pessoas e máquinas. Quando um dia uma nova estrada se tornar mais conveniente, ninguém sentirá falta da estrada antiga.

A roda dos tempos está avançando e sempre há algumas habilidades que desaparecerão lentamente com a evolução da forma como a sociedade funciona.

Tags relacionadas

Artigos relacionados

Comentários

0/500
Captcha (click to refresh)
Sem comentários