2026-09-26
又又又又是中国模型:Hugging Face语音识别和翻译,两个榜一
Hugging Face今年3月出的报告里,过去一年的模型下载,中国占了41%,美国是36.5%;Artificial Analysis的开源权重模型榜,前六名全是中国实验室;OpenRouter上按token量排,前五名里有四个是中国模型。 AI时代,中国大模型公司的开源文化整得风生水起,跟海对面以闭源为主的生态形成了典型的对比。 这几组数是我前几天做开源模型研究的时候查的,然后呢,查着查着,发现个意料之外的发现。前几天Hugging Face上语言相关模型分类下的两个趋势榜第一:Confucius4-R2T2在自动语音识别,Confucius4-T3PO在翻译。 Hugging Face上现在挂着300多万个模型,光自动语音识别这一个分类就有3.6万多个,翻译也有1.7万多个,趋势榜排的是最近这段时间谁最热。R2T2做实时语音识别,放上去才两个礼拜左右,算是最近被追得最热的实时语音模型了。 另一个T3PO是做实时翻译的,在翻译分类也还挂在第一。 我前几天做研究的时候,盯的几乎全是通用大模型,比谁更聪明、谁被调用得更多。这回两个第一落在语音识别和翻译上,写稿的时候,翻译分类趋势榜的前十里有一半是中国公司放出来的模型。中国的开源模型,已经从通用大模型一路铺到了语音、翻译这些更细的方向上了。 说实话,我对网易有道的印象,大概还停在有道词典、词典笔那儿。然后呢,我点进它在Hugging Face上的主页往前翻了翻,才发现它往上放模型已经放了两年多,前年是检索用的embedding和rerank模型,去年是推理和数学模型,今年5月、6月是多模态和语音合成,这个月是这两个,后面这几个名字里都带着Confucius,也就是有道2023年就发了的教育大模型「子曰」。没想到它做模型已经做了这么久。 这两个模型,一个管实时转写的时候哪几个字可以先定下来,一个管同传的时候哪半句话可以先开口翻译。我这两天把它俩的模型卡和源码翻了一遍,又拿自己的口播、苹果发布会、英伟达财报电话会的录音实际跑了一轮。 一、R2T2:出了的字,就不再改 你只要开过实时字幕,大概都见过这个画面:一句话还没说完,字幕先冒出几个字,过半秒被改掉,改完又变,一整行字在那跳。其实呢,模型是边听边猜的,猜错了就回头改,这种做法一般叫伪流式;不想让字跳,就只能等一句话说完再上屏,字是稳了,但慢了好几秒。 R2T2是Real Real-Time Transcription的缩写,是个真流式模型:每来一小段音频(80毫秒到2秒可调,默认160毫秒)就出字,没把握的字先不出,出了的字就是最终结果,之后不再改。拿我口播里的一句话来画,两种做法在屏幕上大概是这样的: 「有没有把握」这个判断是训出来的。有道自己设计了一套训练数据,有稳定前缀数据、强制时间对齐数据和词元级音频切分数据,再配合最长稳定前缀(Longest Stable Prefix,LSP)的学习范式,让模型自己判断什么时候可以把一段字定下来、什么时候还得再听一会儿,定下来的字再作为上下文喂回去,帮它判断后面的字。每来一段音频,它都会走一遍这个循环: 模型卡里有一组数:把基座模型直接按160毫秒一段、出了不许改的方式来跑,英文LibriSpeech clean的错误率是22.30%,中文会议场景是20.38%;R2T2在同样的条件下分别是2.13%和7.27%。有道在GitHub上还放了两张汇总图,是在一堆测试集上取的平均,上面一组是出了字就不改的真流式,下面一组是允许回改的伪流式,左边是错误率,右边是延迟: 中文这张,R2T2在160毫秒一段的设置下,质量优先档的错误率是6.42%,延迟优先档把平均延迟压到了0.32秒;英文那张分别是6.13%和0.21秒: 模型卡对这组结果的说法是,准确率接近离线识别,平均延迟在200到600毫秒之间。 二、T3PO:什么时候开口翻译 T3PO是个140亿参数级的纯文本模型,接在R2T2这种流式ASR后面,ASR每吐出一点英文,它就判断这时候要不要翻。 它的推理协议是这样的(我是让agent帮我读了半天推理代码才搞明白的):每次请求,把已经翻过的「原文¦译文」历史和当前还没翻的那截原文一起塞进去,模型输出空,就是WAIT,接着等;输出了文字就是TRANS,这一段定下来进历史,以后不再改。和R2T2一样,出去的字不收回。 我拿苹果9月发布会iPhone Duo那一段试了一下,按苹果官方的英文字幕一个词一个词往里喂: 「C2 also delivers faster」之后,它连着等了5次,一直等到「in the US」出来才开口,可能是因为中文得把「在美国」放到「增加了5G毫米波支持」前面,没听到地点这句话说不顺。然后它把「all while」先翻成「同时」丢了出去,没等后半句。这一段里的续航小时