APP下载

AI趋势周报第126期:国、台语和客语都能读写!DeepQ用12年大数据训练出国产自然语言平台,未来将开源

消息来源:baojiabao.com 作者: 发布时间:2026-08-12

报价宝综合消息AI趋势周报第126期:国、台语和客语都能读写!DeepQ用12年大数据训练出国产自然语言平台,未来将开源

开发疾管署防疫Chatbot疾管家的DeepQ团队,近日推出NLP平台T-BERT,用60多万颗GPU和平行运算架构来加速开发,学习时间6小时就完成。

重点新闻(0327~0402)

DeepQ     T-BERT     自然语言处理  

国、台语和客语都能通!DeepQ用12年新闻大数据训练出T-BERT未来还要开源

HTC健康医疗事业部DeepQ不止打造拥有百万用户的抗疫机器人疾管家,近日还推出新一代自然语言处理平台T-BERT,是团队利用12年来国、台语和客语新闻、线上教材、朗读比赛等资料训练而成,可读、写国台语和客语,并将应用于Chatbot的语义分析和问答互动,像是疾管家、兰医生等。

该平台由DeepQ与台大资工系副教授廖世伟联手开发,DeepQ资深处长郑志伟指出,团队在Google发表超强自然语言处理预训练模型BERT后,就开始计划以其Transformer架构,来打造适合台湾本土的BERT。于是,团队锁定国语、台语和客语,搜集了数十年新闻资料,以及台语和客语等专属文字资料,作为训练素材;而在训练T-BERT模型时,团队特别利用了64万多颗GPU和平行运算架构,来加速训练,提升60倍运算时间,将学习时间缩短为6小时。目前,T-BERT已能自动分类9大类的国语新闻,如财经、国际等,准确度达93.7%。另一方面,由于台语、客语数据库相对较小,团队采2阶段微调方法,来提升准确度。

接下来,T-BERT将支援语音转文字功能,就可听懂国、台语和客语,来进行问答。DeepQ总经理张智威也指出,未来,团队将开源释出T-BERT。(详全文)

  Google     公共资料集    BigQuery ML  

Google发起COVID-19公共资料集计划,研究员还可用BigQuery ML来建模不收额外费用

科技巨头Google结合数据力和运算力来对抗武汉肺炎(COVID-19)疫情,日前宣布启动COVID-19公共资料集计划,来网罗目前各组织释出的资料集,比如约翰霍普金斯大学CSSE的疫情追踪地图、世界银行的全球卫生资料、开放街图资料(OpenStreetMap)等,然后整合为一个数据库,免费让研究员快速查找资讯。

此外,Google也指出,研究员可直接使用自家机器学习服务BigQuery ML和资料集中的数据,来训练机器学习模型,不须额外付费。最后,对公共资料集计划有兴趣的研究者,可自Google Cloud Console使用这些资料集,该计划有效期至今年9月15日。(详全文)

  Uber     分散式训练    计算函式库  

上千台机器大规模训练AI更轻松!Uber开源分散式训练函式库Fiber

大量的算力可让机器学习算法大规模扩展,也让分散式训练成为可能。但这种大规模分散式训练仍有些挑战,比如在本地端和在生产端执行程式码,会有一大段落差,而且缺乏动态扩展方法、没有错误控管和学习成本过高等。

为解决这些问题,Uber和OpenAI团队联手开发分散式训练函式库Fiber,可轻松执行分散式机器学习训练,还能扩展至上百甚至上千台机器,且不需要专用硬件或设备。Fiber提供了和Python一样的标准多重处理(Multi-processing)API,因此容易上手;另一方面,使用者不需要部署Fiber,只要在电脑丛集上,像执行其他普通应用程序即可。

在架构上,Fiber由API层、后端层和丛集从组成,API层提供基本常用的模组,像是流程处理、管理器、伫列等。后端层负责电脑丛集上建立或终止的任务,丛集层则由不同管理器组成,可帮助Fiber管理、追踪不同工作,降低Fiber本身所需追踪的任务。在使用上,Fiber可支援Python 3.6版本或以上的Linux系统,也能支援Google Cloud等公有云上的K8s。(详全文)

  Element AI   武汉肺炎       自然语言处理  

加拿大AI新创免费开源NLP工具,帮研究者找出武汉肺炎关键文献

加拿大AI新创Element AI日前开源一套搜索工具,可让研究者利用自然语言,从COVID-19开放研究资料集(CORD-19)中找出关键资讯。进一步来说,CORD-19是美国产官学界为对抗疫情,联合建立的开放研究资料集,号称资讯全球最丰富,汇集了4万4千多篇相关论文。然而,其中有许多论文尚未经过同侪评审,因此,要找出关键资讯,可得花上一番功夫。

为帮助研究者快速找到所需的资讯,Element AI开源自家语义搜索工具Knowledge Scout,研究者可以自然语言输入关键字、词组,甚至是整个段落,搜索引擎就能从CORD-19中,找出语义相关的资料。Element AI指出,这套语义搜索模型可以找出不同资讯间的关系,并会随着时间来学习、改进,同时建立隐性知识库。未来,Element AI还要将更多武汉肺炎相关资料集,纳入这套工具的搜索范围。(详全文)

  Nvidia   超级采样技术     DLSS 2.0  

Nvidia新版AI超级采样技术DLSS 2.0亮相,玩Game也可享受4K画质

Nvidia近日发表新版深度学习超级采样技术DLSS 2.0,不仅能即时渲染画面,还能达到超分辨率等级。这是因为,DLSS 2.0可渲染更少像素,再以AI产生清晰、高分辨率的影像。

相较于DLSS 1.0,DLSS 2.0采用全新模型,先以非特定游戏内容来训练跨游戏的通用网络,再于游戏执行时,取得其他训练资料,产出品质更高的画面。此外,DLSS 2.0执行AI模型的速度,是前一代的两倍,大幅提高每秒帧数(FPS)。而DLSS 2.0提供品质、平衡和效能三种模式,其中,效能模式可提高渲染影像4倍分辨率,等于可从1080p转换为4K分辨率。(详全文)

 

 

Google    游戏服务器托管     Kubernetes  

Google推出游戏服务器托管服务,让游戏开发商用K8s管理全球游戏服务器机群

Google发表云端游戏服务器服务Game Servers测试版,是一款K8s游戏服务器托管平台Agones的服务,可让企业简单管理全球多丛集游戏服务器机群,提供了自动缩放排程规划,也可用来进行A/B或金丝雀测试。

3年前,Google与法国知名游戏开发业者Ubisoft打造Agones平台,用户可直接在K8s上托管、执行和扩展专有的游戏服务器,并管理游戏服务器的生命周期。现在,Agones现有用户,只要使用Game Servers API在Agones丛集中注册,就能加入托管服务。Google指出,该服务可让用户简单调度资源,比如游戏举办特别活动时,可按日期事先安排额外容量,来应付爆量等。(详全文)

MetNet    天气预测     降雨率  

快狠准!MetNet模型精准告诉你未来8小时降雨率

Google近日发表了神经天气模型MetNet,可精准预测未来8小时降雨率。MetNet是一款深度神经网络(DNN),能以每2分钟为区间来预测,分辨率可达1公里,表现还比起美国最先进的物理模拟模型好,几秒钟就能完成计算,比原本1小时快上好几倍。

有别于传统物理模拟,Google开发的天气预报方法,是以深度神经网络来预测,可利用TPU或GPU等资源来执行平行运算,来找出资料模式。MetNet可自动取得雷达感测系统(MRMS)和环境观测卫星系统(GOES)的降雨预测值,作为模型输入值,而且不需人工注释。然后,模型会产生概率分布,团队可用来判断各区域的降雨概率。(详全文)

呼吸音     肺炎      听诊系统  

时时把关!AI隔空让医生了解患者心音

自疫情爆发以来,许多医生穿上隔离衣,却难以透过听诊器检查病人心跳。台湾新创聿信医疗开发的AI连续辅助听诊系统,正好可解决这个问题。这套系统包含贴在病人胸口、仅13克的微型听诊器和贴片,以及一支可执行AI的手机,可不间断检测呼吸声,随时侦测肺脏与不同肺叶的变化,并视觉化呈现,来告诉医护人员病人动态。

这套AI模型由过去临床测试纪录的资料训练而成,包括1,800人次、8,000多小时的呼吸声音资料,其中30万笔资料也已完成标注。该系统目前于台大医院、亚东医院测试,能正确检测呼吸率、气喘音、痰音、啰音等肺部异常音。除了肺炎患者,连续呼吸监测还可应用于非插管的麻醉手术,以降低意外发生。(详全文)

图片来源/TensorFlow、Sam\'s Club、微软

 AI趋势近期新闻 

1. 华为开源专门打造AI App的深度学习框架MindSpore

2. Nokia 5G AVA认知服务平台将为电信商推出AI服务

3. Google发表语义反应器Semantic Reactor,来强化自然语言理解能力

4. 必胜客靠AI追踪顾客浏览轨迹,挑出犹豫客及时发送限时折价券抢订单

资料来源:iThome整理,2020年4月

 
 
 
 
2020-04-01 16:46:00

相关文章