返回上一页
多拉:藏文版“豆包”背后的“孤勇者”
来源:科技日报 作者:张添福 2026-08-12
“请讲述格萨尔王的故事。”用户发出指令,对应内容即可生成,汉语、藏语与英语互译同步完成。这便是近期备受业界关注的智达藏语大模型。
今年,这款被称为藏文版“豆包”的人工智能大模型,上线仅一个月,人机互动量就超过1000万次。而在产品“出圈”之际,其研发团队负责人——青海师范大学教授多拉,走进了公众视野。
今年,多拉获评“青海省最美科技工作者”。
带团勇闯AI无人区
长期以来,藏语人工智能研发,近乎一片空白。
这不是没有原因的。藏语有安多、康巴、卫藏三大方言,上百种次方言和地方土语。各个方言差异大,有时相邻两个县的人都难以顺畅交流。除此之外,藏语书写系统独特,而且语料储备严重不足,国内没有成熟技术可以借鉴。
“这是全球人工智能研发最具挑战的领域之一,是一片无人区。”多拉这样介绍自己的工作。
这项任务,工程量浩大,相关人才稀缺,技术路径复杂。国内鲜有科研人员涉足,多拉说自己是“孤勇者”。
不过,多拉有他的底气。
这位在计算语言学与藏文信息处理领域摸爬滚打了大半辈子的学者,比任何人都清楚藏语的价值。
“那不是一串冰冷的语言符号,而是一个民族千年的记忆。”多拉说,如果这些声音不能在数字时代延续,将是一种怎样的失落?
“那就从零开始吧。”多拉对自己说,也对团队里的年轻人说。
兵分四路搜集语料
藏语大模型的根基是高质量的数据——语料。
2023年盛夏,多拉将团队成员分成四组,把他们派往青海6个自治州、甘肃甘南和四川阿坝。
那是真正的一线。牧区的帐篷里,老人们用口音浓重的藏语讲述着古老传说;县城档案馆里,泛黄的地方文献落满灰尘……这些声音和文字,几乎没有被认真、系统地记录过。
多拉和团队成员带着录音设备,带着尊重和耐心,一点点采集语料。有些地方要骑马才能到达,有些方言只有七八十岁的老年人才说得地道,有些口音之间的细微差别需要反复比对、确认。
“每500小时的语料,就需要47万个句子来支撑。”多拉说这话时,语气平淡。
没有人知道,这些数字背后是一个个不眠夜。高峰时期,97名数据标注人员同时开工,昼夜轮转。多拉白天授课、统筹实验室运转,夜晚伏案钻研技术难题。团队成员劝多拉休息,他却摆摆手说:“数据不等人,方言不等人,那些年逾古稀的老人们,也等不了。”
历时一年半,多拉和团队建成2万小时的藏语语料库,其藏语口语识别准确率突破92%。在此基础上,多拉和团队攻克藏语语音转写、语音合成、多语种翻译、OCR文字识别、AI人机交互五大技术。2026年2月,智达藏语大模型上线。
扛起文化传承重任
在多拉眼中,团队的科技成果就像自己的“孩子”。很多人不知道,智达藏语大模型不是多拉的第一个“孩子”。
多年前,他主导研发的云藏搜索引擎,被称为藏文版“百度”,服务全球90多个国家和地区的用户。
多拉的“孩子”还有很多。他主导制定了《信息处理用藏文分词规范》《信息处理用藏语词类标记集》等5项国家标准,让藏文信息处理有了统一标准。
除此之外,他还牵头实施藏文典籍数字化保护工程,带领团队成员一页页扫描、识别、录入、解析藏医药古籍、历史文献,让千年古籍在数字世界里获得永生。
如今,多拉和团队又有了新任务——把121种藏语次方言“装”进智达藏语大模型。这意味着,他们的采集“版图”要从现有的三大方言区,向那些地图上不易找到的角落延伸——雪山脚下的牧村、河谷深处的寨子、只有几十户人家的偏远定居点。
“我们不仅要让藏语实现数字化,而且要让每一种方言土语,无论大小,都有自己的数字声音。”多拉说,“这不仅是研发任务,而且是一份责任。”
(通讯员 范旭光)
《科技日报》(2026年8月12日 05版)
最新资讯- 林芳兵:为智能充电桩设计“大脑”
- 崔洪芝:为大国重器披上“铠甲”
- 多拉:藏文版“豆包”背后的“孤勇者”
- 致敬大国院士 赓续科学薪火——专访刘嘉麒院士纪实
- 百年铸钢魂 一生赤子心——追忆中国工程院院士、我国
- 熊榆:AI时代的英国定位,从创新基因到规则制定
- 弘扬科学家精神·强国先锋丨他们的答案在海底
- 中银香港科创奖获得者余长源:把实验室建在产业链上,
- 邓文洪:三赴南极 揭开鸟类生态谜题
- 民联网:一位挂职副县长的为民初心与务实答卷
- “雷达泰斗” 张履谦院士喜迎百岁华诞 谢寅平一行前
- 孙宝国:农业现代化是食品现代化的基础与保障
- 祝贺!中国科学院院士程和平获中国生物物理学会最高奖
- 殷鸿福院士:坐热寒窗十年“冷板凳”,淬炼人生的“金
- 王阳元院士:中国芯的灵魂是中国心
手机版

公众号

头条号


