APP下载
报价宝  ›  资讯  › 

阿里云 EasyNLP 跨模态学习能力再升级,电商文图检索效果刷新 SOTA

报价宝 来源:baojiabao.com 发布时间:2022-12-21 17:11:05 09月24日更新
报价宝综合消息阿里云 EasyNLP 跨模态学习能力再升级,电商文图检索效果刷新 SOTA

近日,阿里云机器学习 PAI 开源框架 EasyNLP 进行升级发布,推出了融合了丰富电商场景知识的 CLIP 模型,在电商文图检索效果上刷新了 SOTA 结果,并且将上述模型免费开源,贡献给开源社区。

CLIP(Contrastive Language-Image Pre-training)是一种经典的文图跨模态检索模型,它在大规模图文数据集上进行了对比学习预训练,具有很强的文图跨模态表征学习能力。EasyNLP 借鉴 CLIP 的轻量化、易迁移的预训练架构,构建基于 CLIP 包含图像和文本 Encoder 两部分的双流模型,同时基于商品数据,以优化电商场景的文图检索优化。

Fashion-Gen 数据集是一个大规模的时尚场景的图文数据集,以 Fashion-Gen 数据集为例,EasyNLP 基于 pai-clip-commercial-base-en 和 pai-clip-commercial-large-en 这两个模型在 Fashion-Gen 数据集上进行了 20 个 epoch 的微调。实验结果表明,相比于现公布的 SOTA 模型(CommerceMM),电商 CLIP-large 模型在文到图和图到文的检索结果上均有显著提升,评测指标最高提升了 8.7~15 个百分点。

除此之外,电商 base 模型在文到图与 CommerceMM 相当检索结果下,使用了更少的参数量。由此可见,电商 CLIP 无论在 large 还是 base 图像 Encoder 的设置下,都取得了有竞争力的电商场景跨模态检索能力。

文到图检索评测结果

图到文检索评测结果

目前,电商 CLIP 可在 EasyNLP 中直接安装使用,在未来,EasyNLP 框架会集成更多 NLP 的多模态的知识模型,覆盖各个常见领域和任务,同时也将集成更多 SOTA 模型(特别是中⽂模型),来⽀持各种 NLP 和多模态任务,共建 NLP 和多模态算法库。

文章标签: 模型 电商 检索 模态 数据 结果 文图 场景 学习 评测 能力 任务 同时 图像 图文 大规模 更多 框架 知识 评测结果 报价宝 降噪耳机价格 耳机价格 红米手机价格 华为手机价格 小米手机价格 电视机价格 笔记本电脑价格 笔记本价格 汽车价格 汽车价格 电视机价格 小米手机价格 华为手机价格 耳机价格