Google将推动REP成为正式标准,开源robots.txt解析器

Google在7月1日宣布,将推动发展历史长达25年的机器人排除协定(Robots Exclusion Protocol,REP)成为正式标准,同时释出Google内部所使用的robots.txt解析器,以协助开发人员打造客制化的解析工具。
REP又称为robots.txt,是存放在网站根目录下的文字档案,它能与网络搜索引擎的漫游器或机器人交流,主要用来描述网站上的各式内容是否同意被漫游器或机器人取得。
Google表示,自从Martijn Koster在1994年建立REP的初期标准再加上其它网站管理员的补充之后,REP已然成为产业标准,协助网站业者管理服务器可被或禁止被爬梳的资源,亦受到各大搜索引擎的青睐,不过,它一直未成为官方的网络标准。
由于它只是个产业标准,因此开发人员解析REP的方式多少有些不同,而且从未更新过的REP也未纳入现代的边角案例,对网站所有人来说,模糊的产业标准令他们难以撰写正确的规则。于是Google与REP的原始作者、各大网站管理员及其它搜索引擎业者合作,共同向网络工程任务小组(Internet Engineering Task Force,IETF)提交了REP草案,以期让REP成为正式标准。
这份草案集结了由Googlebot、其它主要漫游工具,以及约5亿个网站所仰赖的robots.txt规则,它并未改变1994年所建立的规则,而是定义了robots.txt进行解析或比对时未曾被定义过的所有场景,进而将它延伸到现代网络。
例如不只是HTTP,不管是FTP或CoAP等基于URI的传输协定未来都可使用robots.txt,另也提出robots.txt的档案大小限制,快取时间最多可达24小时以方便网站更新robots.txt,就算暂时无法存取robots.txt也会记得原本禁止存取的网页。
此外,为了减轻开发人员的负担,Google亦开源了内部系统用来解析及比对robots.txt规则的C++函式库,该解析器纳入了Google近20年来的经验,也包含了边角案例,以协助开发人员打造客制化的解析工具。
