LIVESSI 79,780.00▲0.01%
未登录 · 登录

大厅 / 全部 / 多模态视觉

多模态视觉

VISION · ALL REGIONS

收录 162今日新增 0数据源 GitHub 每日快照

多模态视觉分类当前收录 162 AI Skill,按 S-Score 排名靠前的有 tesseract(S·90)ultralytics(S·89)PaddleOCR(S·89)。S-Score 基于 GitHub 星标量级与维护活跃度算法计算,每小时重排、付费不影响排名,数据每日快照。

本榜单每小时重排 · 方法论
1tesseract最老牌的开源 OCR 引擎,百余种语言文字识别90 76.5k+95
2ultralyticsYOLO11 目标检测/分割/追踪,工业级实时视觉89 61.6k+224
3PaddleOCR百度飞桨 OCR 工具箱,把 PDF/图片变成 AI 可用的结构化数据89 89.5k+478
4supervision可复用的计算机视觉工具库:检测、追踪、标注全套88 50.1k+152
5tesseract.js纯 JavaScript OCR,支持 100+ 语言85 38.7k+10
6segment-anythingMeta 万物分割 SAM,一键抠出任意物体84 54.9k+29
广告位招商中 —— 你的产品出现在这里自助投放 · 周结算 · 广告内容与榜单排序无关了解 →广告 AD
7CLIPOpenAI图文对比学习基座84 34.3k+35
8Umi-OCR免费开源离线 OCR 识别软件83 47.3k+135
9unilm微软统一预训练:跨任务/语言/模态83 22.2k+9
10Awesome-Multimodal-Large-Language-Models多模态大模型最新研究资源合集82 18.0k+8
11sam2SAM 2:图像视频统一分割,追踪任意对象82 19.9k+39
12rerun多模态机器人数据的可视化查询与训练流81 11.4k+40
13EasyOCR开箱即用OCR,支持80余种语言81 30.0k+10
14LLaVA视觉指令微调,开源多模态对话大模型80 25.0k+8
15chandra精准处理复杂版面的OCR识别模型79 12.3k+32
16RapidOCR多语言多推理后端的OCR工具包79 7.8k+90
17X-AnyLabelingAI 辅助数据标注:SAM 等模型加持791 10.4k+64
18JanusDeepSeek Janus:统一多模态理解与生成模型78 17.8k
19ddddocr通用验证码识别OCR的Python库77 14.7k+24
20doctr深度学习驱动的文档文字识别库77 6.3k+11
21minimind-v2小时从零训练65M参数视觉多模态VLM77 8.6k+50
22mmfMeta FAIR 的视觉语言多模态研究框架75 5.6k
23InternVL性能对标GPT-4o的开源多模态对话模型75 10.2k+7
24MineContext主动感知上下文的AI伙伴75 5.5k+15
25mteb跨语言跨模态的嵌入模型评测基准75 3.4k+2
26VLM-R1强化学习增强的视觉理解 VLM75 6.0k+4
27GroundingDINO用文字框选图中目标,开放词汇检测75 10.6k+26
28OSWorld多模态智能体真实电脑环境基准测试741 3.1k+12
29ai类型安全、跨平台的TypeScript AI SDK74 3.1k+31
30Eagle数据为中心策略打造的前沿视觉语言模型73 3.6k+31
31Qwen-VL阿里通义千问视觉语言模型官方仓库73 6.7k
32CHINESE-OCR中文场景文字检测与不定长OCR识别73 3.0k
33genai-processors轻量级Python并行内容处理库,面向生成式AI72 2.1k
34docarray多模态数据表示、存储与检索库72 3.1k
35DataDesignerNeMo合成数据生成工具,助力模型训练72 2.2k+8
36Ask-Anything支持视频理解的类ChatGPT多模态应用72 3.4k+2
37SwiftOCRSwift编写的快速简单OCR识别库71 4.6k
38DeepSeek-VLDeepSeek视觉语言模型,面向真实场景图文理解71 4.2k+4
39InternVideo视频基础模型,支持多模态视频理解71 2.4k+8
40mmocrOpenMMLab出品的文字检测识别工具箱71 4.8k
41face.evoLVe高性能人脸识别开源库70 3.6k+2
42deep-text-recognition-benchmark深度学习文字识别基准测试框架70 3.9k+3
43parlor设备端实时多模态AI,支持语音视觉自然对话70 2.1k+10
44tesserocrTesseract OCR的Python封装库70 2.2k
45NExT-GPT任意到任意的多模态大语言模型70 3.6k
46SimpleHTR基于TensorFlow的手写文字识别系统70 2.2k
47text-detection-ctpn基于CTPN模型的场景文本检测70 3.4k
48ShowUI面向GUI Agent的视觉语言动作模型70 1.9k+1
49CRAFT-pytorch文本区域感知检测官方实现CRAFT70 3.4k
50AdelaiDet实例级目标检测识别开源工具箱70 3.5k+1
51Awesome-LLM4AD自动驾驶LLM相关资源精选清单70 1.9k
52tesseract-ocr-for-phpPHP语言的Tesseract OCR封装库69 3.0k+3
53ha-llmvision为智能家居提供AI视觉理解能力69 1.5k+8
54TrWebOCR开源中文离线OCR,识别率媲美大厂69 2.9k
55InternLM-XComposer多模态大模型,支持长时流式视频音频交互69 2.9k+2
56gosseractGo语言的Tesseract OCR封装库69 3.1k+1
57LLaVA-OneVision-2开放的多模态大模型训练框架69 1.2k+4
58awesome-segment-anythingSegment Anything相关资源合集69 1.7k
59thepipe视觉语言模型驱动的复杂文档解析工具69 1.5k+1
60tools-ocr跨平台树洞OCR文字识别小工具69 3.1k

展示前 60 名 · 完整榜单见 每日热榜 →

SKILL·STUDY · 夜市每 10 分钟补货一次 · 排名公正性政策SKILL.STUDYS·96README 徽章 · 一键佩戴本夜市靈感來自 士林 · 寧夏 · 饒河