设置
  • 日夜间
    随系统
    浅色
    深色
  • 主题色

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

发布时间: 来源: 量子位

即插即用F3O速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

CLIP长文本能力被解锁,图像检索任务表现显著提升!F3O速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

一些关键细节也能被捕捉到。上海交大联合上海AI实验室提出新框架Long-CLIPF3O速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

△棕色文本为区分两张图的关键细节F3O速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

Long-CLIP在保持CLIP原始特征空间的基础上,在图像生成等下游任务中即插即用,实现长文本细粒度图像生成——F3O速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

长文本-图像检索提升20%,短文本-图像检索提升6%。F3O速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

解锁CLIP长文本能力

CLIP对齐了视觉与文本模态,拥有强大的zero-shot泛化能力。因此,CLIP被广泛应用在各种多模态任务中,如图像分类、文本图像检索、图像生成等。F3O速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

但CLIP的一大弊病是在于长文本能力的缺失F3O速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

首先,由于采用了绝对位置编码,CLIP的文本输入长度被限制在了77个token。不仅如此,实验发现CLIP真正的有效长度甚至不足20个token,远远不足以表征细粒度信息。F3O速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

文本端的长文本缺失也限制了视觉端的能力。由于仅包含短文本,CLIP的视觉编码器也只会提取一张图片中最主要的成分,而忽略了各种细节。这对跨模态检索等细粒度任务是十分不利的。F3O速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

同时,长文本的缺乏也使CLIP采取了类似bag-of-feature(BOF)的简单建模方式,不具备因果推理等复杂能力。F3O速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

针对这一问题,研究人员提出了Long-CLIP模型。F3O速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

具体提出了两大策略:保留知识的位置编码扩充(Knowledge-Preserving Stretching of Positional Embedding)与加入核心成分对齐(Primary Component Matching)的微调策略。F3O速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

保留知识的位置编码扩充

一个简单的扩充输入长度、增强长文本能力的方法是先以固定的比率 λ1 对位置编码进行插值,再通过长文本进行微调。F3O速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

研究者们发现,CLIP的不同位置编码的训练程度是不同的。由于训练文本很可能以短文本为主,较低位的位置编码训练较为充分,能够精确地表征绝对位置,而较高位的位置编码则仅能表征其大致的相对位置。因此,对不同位置的编码进行插值的代价是不同的。F3O速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

基于以上观察,研究者保留了前20个位置编码,而对于剩下的57个位置编码,则以一个更大的比率λ2 进行插值,计算公式可表示为:F3O速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

实验表明,相较于直接插值,该策略可以在支持更长的总长度的同时大幅提升在各个任务上的性能。F3O速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

加入核心属性对齐的微调

仅仅引入长文本微调会使模型走入另一个误区,即一视同仁地囊括所有细节。针对这一问题,研究者们在微调中引入核心属性对齐这一策略。F3O速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

具体而言,研究者们利用主成分分析(PCA)算法,从细粒度的图像特征中提取核心属性,将其余属性过滤后重建粗粒度图像特征,并将其与概括性的短文本进行对齐。这一策略既要求模型不仅能够包含更多的细节(细粒度对齐),同时还能识别并建模其中最为核心的属性(核心成分提取与粗粒度对齐)。F3O速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

△加入核心属性对齐的微调流程F3O速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

即插即用在各种多模态任务中

在图文检索、图像生成等领域,Long-CLIP可即插即用地替换CLIP。F3O速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

比如图文检索,Long-CLIP能够在图像与文本模态捕捉更多细粒度信息,从而可以增强相似图像和文本的区分能力,大幅提升图文检索的表现。F3O速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

无论是在传统的短文本检索(COCO、Flickr30k),还是在长文本检索任务上,Long-CLIP在召回率上均有显著提升。F3O速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

△短文本-图像检索实验结果F3O速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

△长文本-图像检索实验结果F3O速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

△长文本-图像检索可视化,棕色文本为区分两张图片的关键细节

除此之外,CLIP的文本编码器常被用于文本到图像生成模型中,如stable diffusion系列等。但由于长文本能力的缺失,用于生成图像的文本描述通常都十分简短,无法个性化地订制各种细节。F3O速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

Long-CLIP可以突破77个token的限制,实现篇章级别的图像生成(右下)。F3O速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

也可以在77个token内建模更多地细节,实现细粒度图像生成(右上)。F3O速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

论文链接:F3O速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
https://arxiv.org/abs/2403.15378F3O速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
代码链接:F3O速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM
https://github.com/beichenzbc/Long-CLIPF3O速刷资讯——每天刷点最新资讯,了解这个世界多一点SUSHUAPOS.COM

南方财经全媒体记者马嘉璐 研究员仇雯 广州报道凭借一纸证书,就能获批100万、500万、甚至千万元贷款……数据要素链接金融市场开辟的新财路,正吸引着越来越多的入局者。南方财经全媒 因流量突然剧增,3月21日,陆续有用户在社交平台上表示,月之暗面旗下大模型应用Kimi智能助手的APP和小程序均无法正常使用。截至记者发稿时,相关页面和功能已经恢复正常。Kimi突然爆火,在A 那些在吃完一顿饱饭后不久就在冰箱里翻找零食的人,可能不是胃口好,而是因为寻找食物的神经元过度活跃的缘故。美国加州大学洛杉矶分校心理学家在老鼠大脑中发现了一个回路:即使它们不饿,也会让它 2024年2月,OpenAI公司推出了文生视频人工智能(AI)模型Sora。OpenAI展示了Sora利用少量简短文字提示即可创建逼真视频的能力,并提供了包括一位女士在闪烁着霓虹灯的东京街道漫步,以及一只狗在两个 3月23日消息,据最新爆料,vivo X100s Pro已经获得3C认证,估计 会在5月份前后发布。该机可以看做是vivo X100 Pro的小迭代机型,属于半代升级款,与去年X90s类似。新机从此前的天玑9300升级为天玑9300+,处 在近日开幕的中国国际核工业展览会上,中国核学会理事会党委书记、理事长王寿君表示,中国内地现有在运核电机组55台、居全球第三;在建核电机组26台,保持全球第一。这些成绩的取得,离不开智能化技术 。

本文链接:上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升http://www.sushuapos.com/show-2-4431-0.html

声明:本网站为非营利性网站,本网页内容由互联网博主自发贡献,不代表本站观点,本站不承担任何法律责任。天上不会到馅饼,请大家谨防诈骗!若有侵权等问题请及时与本网联系,我们将在第一时间删除处理。

上一篇: 百亿tokens免费额度,清华系明星AI公司的羊毛薅起来

下一篇: 一款手游有400+个AI角色!腾讯游戏新系统炸场GDC:训练成本大减90%

热门资讯

  • 新AI系统可提供足球制胜战术

    未来的足球场,人工智能(AI)当“大脑”?《自然·通讯》19日发表一项来自谷歌深度思维的最新成果,研究团队报告了一个名为“TacticAI”的系统,能在足

  • 培育一批专利产业化样板企业

    近日,国家知识产权局等五部门联合印发了《专利产业化促进中小企业成长计划实施方案》(以下简称《实施方案》)。《实施方案》提出,到2025年底,中小企业知

  • 人工智能探究癌症发展机理

    据英国《金融时报》网站3月13日报道,科学家们已经在利用人工智能(AI)阐释人体所谓的“黑暗基因组”,并开发一种可能很强大的癌症检测、监测和治疗新

  • 每12个恒星或有一个吞过行星

    据《自然》20日消息称,天文学家对91对恒星所作的光谱分析显示,大约每12个恒星中就有一个可能吞噬了一个行星。在吞噬一个行星后,恒星的化学构成可能发

  • 12项首创技术助力高速公路改扩建

    记者3月20日来到广东深汕西高速公路改扩建施工现场,看到智能机器人、自动化生产线等智能制造设备在不停运行。3月19日—20日,由茅以升科技教育

  • “婴儿香”原来是真的香

    所谓香喷喷的婴儿,到底是源于人们的爱意,还是说确有其香?《通讯·化学》21日一项小型研究首次分析了婴儿和青少年体味化学组成的差异。研究显示

  • AI、死亡与机器人:“数字生命”背后的生意与争议

    21世纪经济报道记者 冯恋阁 王俊 广州、北京报道2013年播出的科幻电视剧《黑镜》第二季中有这样一个故事——女主角玛莎在男友艾什被车祸

  • 曝huaweiMate60已停产!P70蓄势待发:下个月见

    近日有消息称,huaweiMate60已经停产。作为huawei于2023年8月末发布的最新旗舰机型,huaweiMate60的停产意味着huawei新款旗舰或即将上市,接替Mate60。2023

  • 首批量子测量领域国家标准发布

    随着量子技术的发展,利用量子特性突破传统测量技术极限的新一代精密测量技术——量子测量开始得到应用。记者从中国计量科学研究院获悉,由

  • iPhone总裁库克访问中国:女子手持huaweiMate60与其合影

    3月25日消息,国内一场经济高峰论坛上,iPhone总裁蒂姆·库克再次成为焦点。然而,引起人们关注的并非库克的讲话内容,而是一张自拍照片。在论坛现场,一

  • 英国2026年试飞电动“飞的”

    据英国《每日电讯报》网站3月18日报道,根据英国政府的新航空计划,首批电动飞行出租车将于2026年试飞。周一发布的《“飞行未来”行动计划》为飞行出

  • 电子导盲犬可能要来了!相关研究在我国取得新突破

    “啪嗒啪嗒......”一只机器狗在街上迈着规律的步伐,拉着牵引绳的盲人,在它的带领下越过沿路障碍,平稳地行走着,电子导盲犬能否取代传统导盲犬,解决视障

推荐资讯

  • 日榜
  • 周榜
  • 月榜