LIVESSI 79,365.00▲0.01%
未登录 · 登录

大厅 / 🌍 国外 / 多模态视觉

多模态视觉

VISION · GLOBAL

收录 162今日新增 0数据源 GitHub 每日快照

多模态视觉(国外)分类当前收录 162 AI Skill,按 S-Score 排名靠前的有 tesseract(S·90)ultralytics(S·89)supervision(S·88)。S-Score 基于 GitHub 星标量级与维护活跃度算法计算,每小时重排、付费不影响排名,数据每日快照。

本榜单每小时重排 · 方法论
1tesseract最老牌的开源 OCR 引擎,百余种语言文字识别90 75.6k+114
2ultralyticsYOLO11 目标检测/分割/追踪,工业级实时视觉89 60.0k+279
3supervision可复用的计算机视觉工具库:检测、追踪、标注全套88 48.4k+222
4tesseract.js纯 JavaScript OCR,支持 100+ 语言85 38.6k+26
5CLIPOpenAI图文对比学习基座84 34.1k+40
6segment-anythingMeta 万物分割 SAM,一键抠出任意物体84 54.6k+48
广告位招商中 —— 你的产品出现在这里自助投放 · 周结算 · 广告内容与榜单排序无关了解 →广告 AD
7Awesome-Multimodal-Large-Language-Models多模态大模型最新研究资源合集83 18.0k+6
8sam2SAM 2:图像视频统一分割,追踪任意对象81 19.6k+41
9rerun多模态机器人数据的可视化查询与训练流81 11.2k+46
10EasyOCR开箱即用OCR,支持80余种语言81 29.8k+32
11X-AnyLabelingAI 辅助数据标注:SAM 等模型加持80 9.9k+91
12LLaVA视觉指令微调,开源多模态对话大模型80 24.9k+19
13unilm微软统一预训练:跨任务/语言/模态79 22.2k+8
14chandra精准处理复杂版面的OCR识别模型79 11.8k+78
15RapidOCR多语言多推理后端的OCR工具包78 7.3k+60
16doctr深度学习驱动的文档文字识别库78 6.2k+8
17mmfMeta FAIR 的视觉语言多模态研究框架76 5.6k+2
18VLM-R1强化学习增强的视觉理解 VLM76 6.0k+5
19MineContext主动感知上下文的AI伙伴75 5.4k+10
20mteb跨语言跨模态的嵌入模型评测基准74 3.4k+7
21ai类型安全、跨平台的TypeScript AI SDK74 2.9k+21
22OSWorld多模态智能体真实电脑环境基准测试74 3.0k+15
23docarray多模态数据表示、存储与检索库72 3.1k
24DataDesignerNeMo合成数据生成工具,助力模型训练72 2.1k+19
25Eagle数据为中心策略打造的前沿视觉语言模型72 3.3k+39
26genai-processors轻量级Python并行内容处理库,面向生成式AI71 2.1k+3
27SwiftOCRSwift编写的快速简单OCR识别库71 4.6k+1
28mmocrOpenMMLab出品的文字检测识别工具箱71 4.7k+1
29parlor设备端实时多模态AI,支持语音视觉自然对话71 1.9k+9
30AdelaiDet实例级目标检测识别开源工具箱70 3.5k
31ShowUI面向GUI Agent的视觉语言动作模型70 1.9k+6
32ha-llmvision为智能家居提供AI视觉理解能力70 1.4k+5
33deep-text-recognition-benchmark深度学习文字识别基准测试框架70 3.9k+1
34tesserocrTesseract OCR的Python封装库70 2.2k+1
35NExT-GPT任意到任意的多模态大语言模型70 3.6k+1
36CRAFT-pytorch文本区域感知检测官方实现CRAFT70 3.4k
37face.evoLVe高性能人脸识别开源库70 3.6k
38text-detection-ctpn基于CTPN模型的场景文本检测70 3.4k
39SimpleHTR基于TensorFlow的手写文字识别系统70 2.2k
40AdvancedLiterateMachinery阿里OCR团队的文字识别与文档理解项目合集69 1.8k
41gosseractGo语言的Tesseract OCR封装库69 3.1k+2
42tesseract-ocr-for-phpPHP语言的Tesseract OCR封装库69 3.0k
43VLM_survey视觉语言模型研究资源合集69 3.1k
44Awesome-LLM4AD自动驾驶LLM相关资源精选清单69 1.9k+1
45LLaVA-OneVision-2开放的多模态大模型训练框架69 1.2k+11
46Ovis结构化对齐视觉与文本的多模态大模型69 1.5k+8
47awesome-segment-anythingSegment Anything相关资源合集69 1.7k
48DeTikZify将科学图表转为TikZ绘图代码69 1.8k+2
49EASTTensorFlow实现的场景文字检测模型69 3.1k
50MGMMini-Gemini多模态视觉语言模型官方实现69 3.3k
51mPLUG-Owl阿里达摩院出品的多模态大语言模型家族68 2.5k+2
52mPLUG-DocOwl模块化多模态文档理解大模型,支持OCR与问答68 2.4k+2
53thepipe视觉语言模型驱动的复杂文档解析工具68 1.5k
54awesome-deep-text-detection-recognition深度学习文本检测识别精选资源合集68 2.5k+1
55OFA统一架构与模态的序列到序列学习框架68 2.6k
56Awesome-Unified-Multimodal-Models统一多模态大模型项目资源汇总68 1.3k+6
57claude-video-vision让Claude看懂视频的多模态插件67 1.0k+28
58Show-o统一多模态理解与生成的单一Transformer模型67 2.0k+2
59xtreme1一体化多模态数据标注平台,支持点云与大模型67 1.2k+1
60crnnCRNN 卷积循环网络,用于图像序列识别67 2.1k+2

展示前 60 名 · 完整榜单见 每日热榜 →

SKILL·STUDY · 夜市每 10 分钟补货一次 · 排名公正性政策SKILL.STUDYS·96README 徽章 · 一键佩戴本夜市靈感來自 士林 · 寧夏 · 饒河