首页 > 生活分享 > 免费教学 > 谷歌推Scenic:可识别视频内容 并生成详细描述

谷歌推Scenic:可识别视频内容 并生成详细描述

发布时间:2024-04-08 23:47:07来源: 15210273549

Scenic 是一个以注意力模型为重点的计算机视觉研究代码库。

⭐️ 提供 SOTA 模型和基线模型,以及共享库和项目。

⭐️ Scenic 采用 JAX 和 Flax 进行开发,为快速原型设计大规模视觉模型提供支持。

站长之家(ChinaZ.com) 4月7日 消息:Scenic 是谷歌推出的模型,一个专注于计算机视觉领域的代码库,主要用于研究基于注意力的模型。

该库提供了一系列共享的轻量级库,解决训练大规模视觉模型时常见的任务,并包含了几个使用这些库的问题特定训练和评估循环的项目。Scenic 使用 JAX 和 Flax 进行开发,支持开发人员在图像、视频、音频和多模态组合方面开发分类、分割和检测模型。Scenic能识别任意长度的视频内容,并生成详细描述。针对长视频,可以在处理完整个视频前,流式预测视频内容。

Scenic 提供了一些功能,包括用于启动实验、摘要编写、日志记录、性能分析等的样板代码;优化的训练和评估循环、损失函数、度量、双部分匹配器等;以及用于流行视觉数据集的输入管道和强大的非注意力基线模型。

在 Scenic 中,有一些 SOTA 模型和基线模型,这些模型可能是使用 Scenic 开发的,也可能是在 Scenic 中重新实现的。一些项目包括 ViViT、OmniNet、Attention Bottlenecks for Multimodal Fusion 等。此外,Scenic 还提供了一些重现的基线模型,如(ViT)An Image is Worth16x16Words、(DETR)End-to-End Object Detection with Transformers 等。

Scenic 的目标是促进大规模视觉模型的快速原型设计。为了保持代码简单易懂且易于扩展,Scenic 更倾向于通过复制粘贴而非增加复杂性或增加抽象来解决问题。只有当功能被证明在许多模型和任务中广泛有用时,才可能将其上游到 Scenic 的共享库中。

免费教学更多>>

科技出海,长城汽车登陆CES 2025 长期主义的胜利,历经20年,CR-V 2024年终端销售仍接近18万辆 零跑的2024成绩单有多牛?全年交付近30万辆,提前超额完成目标! 中国车企突围之路:做不成偏科生比亚迪,做“全能生”的瑞虎也不错! 别人均奔驰E了!养一台30万的小米SU7,月薪8000都可能一分不剩 大空间够舒适,真四驱足够稳!传祺GS8冬季出行最佳搭档? 开年就摘得周销冠,吉利银河星舰7都做对了什么? 玩力升级,全新高尔夫与你一起奔赴热爱之约! 比亚迪夏杀疯了 24.98万起 能否短期内称霸MPV销量榜前三? 特斯拉年度成绩单!拿下2个世界第一,新能源汽车销量仅输一厂商 新势力车企2024成绩单:谁笑到了最后,谁又在生死边缘徘徊? 小米汽车挤上牌桌,雷军称2025年目标30万辆 上汽集团痛失蝉联18年的销量冠军 小米汽车工厂开放参观预约,你准备好了吗? 全球车企市值排名“巨变”:21家中国车企入围TOP50 小米、比亚迪分列三四 从汽车到战机,中国如何以“模式升维”领跑全球? 2024鸣金收兵:造车新势力疯狂发力,汽车大厂坐怀不乱 小鹏G9限时优惠,至高减免6W,特斯拉时代已经过去? 比亚迪“天神之眼”重磅升级!无图城市领航功能全国开通! 小米SU7掉落山崖一家人安然无恙 事故竟成小米带货现场? 诚意十足!本次零跑C11的OTA都有哪些亮点? 80亿增资落地,北京现代加速布局“在中国 为全球”战略 坚守紧凑级豪华,奥迪A3都做了什么 年至不惑,上汽大众,在改革中诞生,在变革中引领 『网红』难过一周期,『流量』难撑六十年,丰田的持久之道 2024年湖南长沙市发展和改革委员会招聘中级雇员公告 2025年湖南财经工业职业技术学院_衡阳财经工业学院人才引进26人公告 2024年湖南怀化市总工会属事业单位招聘和选调5人公告 2024年湖南衡阳市雁峰区事业单位急需紧缺人才引进6人公告 2024下半年广东肇庆市端州区教育局招聘中小学教师13人公告