Meta的「分割一切」模型横空出世后,已经让圈内人惊呼CV不存在了。
编者按:本文来自微信公众号“新智元”(ID:AI_era),作者:新智元,编辑:桃子 好困,创业邦经授权发布。
Meta的SAM「分割一切」模型刚发布,国内团队就进行了二创,打造了一个最强的零样本视觉应用Grounded-SAM,不仅能分割一切,还能检测一切,生成一切。
(资料图)
Meta的「分割一切」模型横空出世后,已经让圈内人惊呼CV不存在了。
就在SAM发布后一天,国内团队在此基础上搞出了一个进化版本「Grounded-SAM」。
注:项目的logo是团队用Midjourney花了一个小时做的
Grounded-SAM把SAM和BLIP、Stable Diffusion集成在一起,将图片「分割」、「检测」和「生成」三种能力合一,成为最强Zero-Shot视觉应用。
网友纷纷表示,太卷了!
谷歌大脑的研究科学家、滑铁卢大学计算机科学助理教授Wenhu Chen表示「这也太快了」。
AI大佬沈向洋也向大家推荐了这一最新项目:
Grounded-Segment-Anything:自动检测、分割和生成任何有图像和文本输入的东西。边缘分割可以进一步改进。
截至目前,这个项目在GitHub上已经狂揽2k星。
检测一切,分割一切,生成一切
上周,SAM的发布让CV迎来了GPT-3时刻。甚至,Meta AI声称这是史上首个图像分割基础模型。
该模型可以在统一的框架prompt encoder内,指定一个点、一个边界框、一句话,直接一键分割出任何物体。
SAM具有广泛的通用性,即具有了零样本迁移的能力,足以涵盖各种用例,不需要额外训练,就可以开箱即用地用于新的图像领域,无论是水下照片,还是细胞显微镜。
由此可见,SAM可以说是强到发指。
而现在,国内研究者基于这个模型想到了新的点子,将强大的零样本目标检测器Grounding DINO与之结合,便能通过文本输入,检测和分割一切。
借助Grounding DINO强大的零样本检测能力,Grounded SAM可以通过文本描述就可以找到图片中的任意物体,然后通过SAM强大的分割能力,细粒度的分割出mas。
最后,还可以利用Stable Diffusion对分割出来的区域做可控的文图生成。
再Grounded-SAM具体实践中,研究者将Segment-Anything与3个强大的零样本模型相结合,构建了一个自动标注系统的流程,并展示出非常非常令人印象深刻的结果!
这一项目结合了以下模型:
· BLIP:强大的图像标注模型
· Grounding DINO:最先进的零样本检测器
· Segment-Anything:强大的零样本分割模型
· Stable-Diffusion:出色的生成模型
所有的模型既可以组合使用,也可以独立使用。组建出强大的视觉工作流模型。整个工作流拥有了检测一切,分割一切,生成一切的能力。
该系统的功能包括:
BLIP+Grounded-SAM=自动标注器
使用BLIP模型生成标题,提取标签,并使用Ground-SAM生成框和掩码:
· 半自动标注系统:检测输入的文本,并提供精确的框标注和掩码标注。
· 全自动标注系统:
首先使用BLIP模型为输入图像生成可靠的标注,然后让Grounding DINO检测标注中的实体,接着使用SAM在其框提示上进行实例分割。
Stable Diffusion+Grounded-SAM=数据工厂
· 用作数据工厂生成新数据:可以使用扩散修复模型根据掩码生成新数据。
Segment Anything+HumanEditing
在这个分支中,作者使用Segment Anything来编辑人的头发/面部。
· SAM+头发编辑
· SAM+时尚编辑
作者对于Grounded-SAM模型提出了一些未来可能的研究方向:
自动生成图像以构建新的数据集;分割预训练的更强大的基础模型;与(Chat-)GPT模型的合作;一个完整的管道,用于自动标注图像(包括边界框和掩码),并生成新图像。
作者介绍
Grounded-SAM项目其中的一位研究者是清华大学计算机系的三年级博士生刘世隆。
他近日在GitHub上介绍了自己和团队一起做出的最新项目,并称目前还在完善中。
现在,刘世隆是粤港澳大湾区数字经济研究院(IDEA研究院),计算机视觉与机器人研究中心的实习生,由张磊教授指导,主要研究方向为目标检测,多模态学习。
在此之前,他于2020年获得了清华大学工业工程系的学士学位,并于2019年在旷视实习过一段时间。
个人主页: http://www.lsl.zone/
顺便提一句,刘世隆也是今年3月份发布的目标检测模型Grounding DINO的一作。
此外,他的4篇论文中了CVPR 2023,2篇论文被ICLR 2023接收,1篇论文被AAAI 2023接收。
论文地址:https://arxiv.org/pdf/2303.05499.pdf
而刘世隆提到的那位大佬——任天和,目前在IDEA研究院担任计算机视觉算法工程师,也由张磊教授指导,主要研究方向为目标检测和多模态。
此外,项目的合作者还有,中国科学院大学博士三年级学生黎昆昌,主要研究方向为视频理解和多模态学习;IDEA研究院计算机视觉与机器人研究中心实习生曹赫,主要研究方向为生成模型;以及阿里云高级算法工程师陈佳禹。
任天和、刘世隆
安装运行
项目需要安装python 3.8及以上版本,pytorch 1.7及以上版本和torchvision 0.8及以上版本。此外,作者强烈建议安装支持CUDA的PyTorch和TorchVision。
安装Segment Anything:
python -m pip install -e segment_anything安装GroundingDINO:
python -m pip install -e GroundingDINO安装diffusers:
pip install --upgrade diffusers[torch]安装掩码后处理、以COCO格式保存掩码、example notebook和以ONNX格式导出模型所需的可选依赖。同时,项目还需要jupyter来运行example notebook。
pip install opencv-python pycocotools matplotlib onnxruntime onnx ipykernelGrounding DINO演示
下载groundingdino检查点:
1 cd Grounded-Segment-Anything
2 wget https://github.com/IDEA-Research/GroundingDINO/releases/download/v0.1.0-alpha/groundingdino_swint_ogc.pth
运行demo:
模型预测可视化将保存在output_dir中,如下所示:
Grounded-Segment-Anything+BLIP演示
自动生成伪标签很简单:
1. 使用BLIP(或其他标注模型)来生成一个标注。
2. 从标注中提取标签,并使用ChatGPT来处理潜在的复杂句子。
3. 使用Grounded-Segment-Anything来生成框和掩码。
伪标签和模型预测可视化将保存在output_dir中,如下所示:
Grounded-Segment-Anything+Inpainting演示
Grounded-Segment-Anything+Inpainting Gradio APP
python gradio_app.py作者在此提供了可视化网页,可以更方便的尝试各种例子。
网友评论
对于这个项目logo,还有个深层的含义:
一只坐在地上的马赛克风格的熊。坐在地面上是因为ground有地面的含义,然后分割后的图片可以认为是一种马赛克风格,而且马塞克谐音mask,之所以用熊作为logo主体,是因为作者主要示例的图片是熊。
看到Grounded-SAM后,网友表示,知道要来,但没想到来的这么快。
项目作者任天和称,「我们用的Zero-Shot检测器是目前来说最好的。」
未来,还会有web demo上线。
最后,作者表示,这个项目未来还可以基于生成模型做更多的拓展应用,例如多领域精细化编辑、高质量可信的数据工厂的构建等等。欢迎各个领域的人多多参与。
参考资料:
https://github.com/IDEA-Research/Grounded-Segment-Anything
https://www.reddit.com/r/MachineLearning/comments/12gnnfs/r_groundedsegmentanything_automatically_detect/
https://zhuanlan.zhihu.com/p/620271321
本文(含图片)为合作媒体授权创业邦转载,不代表创业邦立场,转载请联系原作者。如有任何疑问,请联系editor@cyzone.cn。
X 关闭
- 1、全球资讯:Meta「分割一切」超进化版来了,IDEA领衔国内顶尖团队打造:检测、分割、生成一切,狂揽2k星
- 2、陈梦总算打破了被左手运动员送走的噩梦。-最资讯
- 3、天天头条:海信视像总裁李炜:场景化消费将重塑显示行业格局
- 4、TOF概念板块龙头股,都给大家整理好了!(4/10)
- 5、全球播报:少儿学唐诗三百首视频_学唐诗三百首全集视频下载
- 6、曝Xbox&《星空》展示会6月12日举办!时长2小时|世界热推荐
- 7、员工涉间谍案 日企CEO首次公开回应:不会退出中国
- 8、短讯!抓好春耕春管 打好丰收基础
- 9、SPORTFIVE旗下高尔夫球员琼·拉姆夺得2023美国大师赛冠军|每日动态
- 10、超前消费诱发“人生透支”:有人大学毕业10年还在还债,有人为还信用卡抢劫 全球新消息
-
青岛公考培训机构,怎样轻松应对申论考试
近年来,公务员考试越来越受到社会的关注,成为许多人心目中的梦想。而在公务员考试中,申论作文是一个很重要的环节,也是一个能够真正考察考
-
克宫:五角大楼外泄文件“相当有趣”
参考消息网4月10日报道综合俄罗斯卫星社、塔斯社、俄新社4月10日报道,俄罗斯总统普京的发言人佩斯科夫10日在当天的记者会上称,外泄到网上的
-
全球报道:数据安全问题频发,企业如何筑牢数据安全保护屏障
近期,企业数据安全问题频发,数据安全依旧是企业目前面临的重大风险之一。作为国投集团数字经济板块的重要企业,美亚柏科以专业的技术团队和
-
极目快评丨小伙用AI“复活”奶奶引争议,以科技慰藉哀思无须苛责 焦点简讯
极目快评丨小伙用AI“复活”奶奶引争议,以科技慰藉哀思无须苛责---“你的身体很脆弱,它会受伤、会生病、会变老、还会死,但数字的你,理论上
-
给女朋友送礼物 天天热推荐
送个杯子吧,把个女孩子一辈子的照片印上,这个杯子一定很有意义的哦!杯子一辈子都有意义!而且杯子一辈子一辈子,印一辈子一辈
-
世界微头条丨金十期货整理|全国主要油厂豆粕成交量数据4月10日:成交总量20.16万吨,较上一交易日增加14.02万吨;其中现货成交20.16万吨。4月7日
金十期货整理|全国主要油厂豆粕成交量数据4月10日:成交总量20 16万吨,较上一交易日增加14 02万吨;其中现货成交20 16万吨。4月7日:成交总量6 1
-
以“三治”融“三力” 为乡村治理振兴护力 实时
人民网上海4月10日电不负春光好时景。从“花朝节”里千余亩梅花争春到“中国美丽休闲乡村”的桃花源,加上眼下近万亩油菜花竞相绽放的景致中,
-
火热对决《超级炸弹人R2》宣传片公开 发售日确认
KONAMI经典《炸弹人》系列最新作《超级炸弹人R2》官方宣布本作将在2023年9月14日发售,目前
-
4万座「围城」,圈住100万个达人梦
FastReading网红名气大一分,MCN能赚的钱就多一分,但话语权也可能少了一分。如果双方闹掰,网红和机构都会面临不小的损失。将素人培养成网红
-
西藏那曲首届乡村振兴活动增加群众销售收入2600余万元-全球热闻
(记者赵朗)记者10日从西藏自治区那曲市“乡村振兴那曲奋进”活动办获悉,2022年那曲市第一届“乡村振兴那曲奋进”活动累计举行各类赛事13624场

