LIVESSI 79,780.00▲0.01%
未登录 · 登录

大厅 / 🌍 国外 / 多模态视觉

多模态视觉

VISION · GLOBAL

收录 162今日新增 0数据源 GitHub 每日快照

多模态视觉(国外)分类当前收录 162 AI Skill,按 S-Score 排名靠前的有 tesseract(S·90)ultralytics(S·89)supervision(S·88)。S-Score 基于 GitHub 星标量级与维护活跃度算法计算,每小时重排、付费不影响排名,数据每日快照。

本榜单每小时重排 · 方法论
1tesseract最老牌的开源 OCR 引擎,百余种语言文字识别90 76.5k+95
2ultralyticsYOLO11 目标检测/分割/追踪,工业级实时视觉89 61.6k+224
3supervision可复用的计算机视觉工具库:检测、追踪、标注全套88 50.1k+152
4tesseract.js纯 JavaScript OCR,支持 100+ 语言85 38.7k+10
5segment-anythingMeta 万物分割 SAM,一键抠出任意物体84 54.9k+29
6CLIPOpenAI图文对比学习基座84 34.3k+35
广告位招商中 —— 你的产品出现在这里自助投放 · 周结算 · 广告内容与榜单排序无关了解 →广告 AD
7unilm微软统一预训练:跨任务/语言/模态83 22.2k+9
8sam2SAM 2:图像视频统一分割,追踪任意对象82 19.9k+39
9Awesome-Multimodal-Large-Language-Models多模态大模型最新研究资源合集82 18.0k+8
10EasyOCR开箱即用OCR,支持80余种语言81 30.0k+10
11rerun多模态机器人数据的可视化查询与训练流81 11.4k+40
12LLaVA视觉指令微调,开源多模态对话大模型80 25.0k+8
13X-AnyLabelingAI 辅助数据标注:SAM 等模型加持791 10.4k+64
14RapidOCR多语言多推理后端的OCR工具包79 7.8k+90
15chandra精准处理复杂版面的OCR识别模型79 12.3k+32
16doctr深度学习驱动的文档文字识别库77 6.3k+11
17MineContext主动感知上下文的AI伙伴75 5.5k+15
18VLM-R1强化学习增强的视觉理解 VLM75 6.0k+4
19mmfMeta FAIR 的视觉语言多模态研究框架75 5.6k
20mteb跨语言跨模态的嵌入模型评测基准75 3.4k+2
21ai类型安全、跨平台的TypeScript AI SDK74 3.1k+31
22OSWorld多模态智能体真实电脑环境基准测试741 3.1k+12
23Eagle数据为中心策略打造的前沿视觉语言模型73 3.6k+31
24DataDesignerNeMo合成数据生成工具,助力模型训练72 2.2k+8
25docarray多模态数据表示、存储与检索库72 3.1k
26genai-processors轻量级Python并行内容处理库,面向生成式AI72 2.1k
27mmocrOpenMMLab出品的文字检测识别工具箱71 4.8k
28SwiftOCRSwift编写的快速简单OCR识别库71 4.6k
29SimpleHTR基于TensorFlow的手写文字识别系统70 2.2k
30deep-text-recognition-benchmark深度学习文字识别基准测试框架70 3.9k+3
31face.evoLVe高性能人脸识别开源库70 3.6k+2
32parlor设备端实时多模态AI,支持语音视觉自然对话70 2.1k+10
33AdelaiDet实例级目标检测识别开源工具箱70 3.5k+1
34CRAFT-pytorch文本区域感知检测官方实现CRAFT70 3.4k
35ShowUI面向GUI Agent的视觉语言动作模型70 1.9k+1
36NExT-GPT任意到任意的多模态大语言模型70 3.6k
37tesserocrTesseract OCR的Python封装库70 2.2k
38text-detection-ctpn基于CTPN模型的场景文本检测70 3.4k
39Awesome-LLM4AD自动驾驶LLM相关资源精选清单70 1.9k
40LLaVA-OneVision-2开放的多模态大模型训练框架69 1.2k+4
41ha-llmvision为智能家居提供AI视觉理解能力69 1.5k+8
42thepipe视觉语言模型驱动的复杂文档解析工具69 1.5k+1
43gosseractGo语言的Tesseract OCR封装库69 3.1k+1
44MGMMini-Gemini多模态视觉语言模型官方实现69 3.3k
45awesome-segment-anythingSegment Anything相关资源合集69 1.7k
46VLM_survey视觉语言模型研究资源合集69 3.1k
47tesseract-ocr-for-phpPHP语言的Tesseract OCR封装库69 3.0k+3
48xtreme1一体化多模态数据标注平台,支持点云与大模型692 1.3k+31
49EASTTensorFlow实现的场景文字检测模型69 3.1k
50mPLUG-DocOwl模块化多模态文档理解大模型,支持OCR与问答68 2.4k
51Awesome-Unified-Multimodal-Models统一多模态大模型项目资源汇总68 1.3k+1
52Ovis结构化对齐视觉与文本的多模态大模型68 1.5k+5
53mPLUG-Owl阿里达摩院出品的多模态大语言模型家族68 2.5k+1
54awesome-vlm-architectures知名视觉语言模型架构汇总列表68 1.3k
55awesome-deep-text-detection-recognition深度学习文本检测识别精选资源合集68 2.5k+1
56OFA统一架构与模态的序列到序列学习框架68 2.6k
57claude-video-vision让Claude看懂视频的多模态插件68 1.3k+11
58Show-o统一多模态理解与生成的单一Transformer模型67 2.0k+1
59groundingLMM生成带目标分割掩码的多模态大模型67 968+1
60crnnCRNN 卷积循环网络,用于图像序列识别67 2.1k

展示前 60 名 · 完整榜单见 每日热榜 →

SKILL·STUDY · 夜市每 10 分钟补货一次 · 排名公正性政策SKILL.STUDYS·96README 徽章 · 一键佩戴本夜市靈感來自 士林 · 寧夏 · 饒河