当地时间8月26日,谷歌发布最新语音转文本模型Gemini 3.5 Transcribe,该模型不仅主打更高的识别准确率,更将能力边界从逐字记录延伸至理解说话人意图并自动整理输出结果,标志着语音识别技术向更深层的语言理解迈进。
与传统语音识别工具不同,Gemini 3.5 Transcribe能够识别说话人的自我修正、自动删除口头禅,并直接将非结构化口语转换为格式化文本。
谷歌称其为迄今"最精准"的语音转文本模型,并已将其引入Android版Gboard及Mac版Gemini应用,同时通过Gemini API向开发者开放预览。
此次发布与Gemini 3.5 Live及Gemini 3.5 Live Experimental同日推出,共同构成谷歌新的Gemini Audio系列。
分析人士指出,随着语音入口加速渗透谷歌旗下Chrome、Gboard等高频产品,语音交互有望逐步替代键盘输入,成为用户与AI系统的主要连接方式。
截至发稿,谷歌股价周四盘中下跌1.37%。
从"逐字记录"到"意图理解"
0
评论 (0)