LIVESSI 79,365.00▲0.01%
未登录 · 登录

大厅 / 全部 / 多模态视觉

多模态视觉

VISION · ALL REGIONS

收录 162今日新增 0数据源 GitHub 每日快照

多模态视觉分类当前收录 162 AI Skill,按 S-Score 排名靠前的有 PaddleOCR(S·91)tesseract(S·90)ultralytics(S·89)。S-Score 基于 GitHub 星标量级与维护活跃度算法计算,每小时重排、付费不影响排名,数据每日快照。

本榜单每小时重排 · 方法论
1PaddleOCR百度飞桨 OCR 工具箱,把 PDF/图片变成 AI 可用的结构化数据91 86.4k+469
2tesseract最老牌的开源 OCR 引擎,百余种语言文字识别90 75.6k+114
3ultralyticsYOLO11 目标检测/分割/追踪,工业级实时视觉89 60.0k+279
4supervision可复用的计算机视觉工具库:检测、追踪、标注全套88 48.4k+222
5tesseract.js纯 JavaScript OCR,支持 100+ 语言85 38.6k+26
6segment-anythingMeta 万物分割 SAM,一键抠出任意物体84 54.6k+48
广告位招商中 —— 你的产品出现在这里自助投放 · 周结算 · 广告内容与榜单排序无关了解 →广告 AD
7CLIPOpenAI图文对比学习基座84 34.1k+40
8Umi-OCR免费开源离线 OCR 识别软件83 46.3k+93
9Awesome-Multimodal-Large-Language-Models多模态大模型最新研究资源合集83 18.0k+6
10sam2SAM 2:图像视频统一分割,追踪任意对象81 19.6k+41
11EasyOCR开箱即用OCR,支持80余种语言81 29.8k+32
12rerun多模态机器人数据的可视化查询与训练流81 11.2k+46
13X-AnyLabelingAI 辅助数据标注:SAM 等模型加持80 9.9k+91
14ddddocr通用验证码识别OCR的Python库80 14.5k+36
15LLaVA视觉指令微调,开源多模态对话大模型80 24.9k+19
16chandra精准处理复杂版面的OCR识别模型79 11.8k+78
17unilm微软统一预训练:跨任务/语言/模态79 22.2k+8
18RapidOCR多语言多推理后端的OCR工具包78 7.3k+60
19doctr深度学习驱动的文档文字识别库78 6.2k+8
20minimind-v2小时从零训练65M参数视觉多模态VLM78 8.4k+34
21JanusDeepSeek Janus:统一多模态理解与生成模型78 17.8k+1
22mmfMeta FAIR 的视觉语言多模态研究框架76 5.6k+2
23VLM-R1强化学习增强的视觉理解 VLM76 6.0k+5
24MineContext主动感知上下文的AI伙伴75 5.4k+10
25GroundingDINO用文字框选图中目标,开放词汇检测75 10.5k+38
26InternVL性能对标GPT-4o的开源多模态对话模型75 10.1k+6
27OSWorld多模态智能体真实电脑环境基准测试74 3.0k+15
28ai类型安全、跨平台的TypeScript AI SDK74 2.9k+21
29mteb跨语言跨模态的嵌入模型评测基准74 3.4k+7
30Ask-Anything支持视频理解的类ChatGPT多模态应用73 3.3k+2
31Qwen-VL阿里通义千问视觉语言模型官方仓库73 6.7k+5
32DataDesignerNeMo合成数据生成工具,助力模型训练72 2.1k+19
33Eagle数据为中心策略打造的前沿视觉语言模型72 3.3k+39
34InternVideo视频基础模型,支持多模态视频理解72 2.3k+4
35docarray多模态数据表示、存储与检索库72 3.1k
36mmocrOpenMMLab出品的文字检测识别工具箱71 4.7k+1
37DeepSeek-VLDeepSeek视觉语言模型,面向真实场景图文理解71 4.1k+3
38parlor设备端实时多模态AI,支持语音视觉自然对话71 1.9k+9
39genai-processors轻量级Python并行内容处理库,面向生成式AI71 2.1k+3
40SwiftOCRSwift编写的快速简单OCR识别库71 4.6k+1
41NExT-GPT任意到任意的多模态大语言模型70 3.6k+1
42CRAFT-pytorch文本区域感知检测官方实现CRAFT70 3.4k
43AdelaiDet实例级目标检测识别开源工具箱70 3.5k
44text-detection-ctpn基于CTPN模型的场景文本检测70 3.4k
45ha-llmvision为智能家居提供AI视觉理解能力70 1.4k+5
46ShowUI面向GUI Agent的视觉语言动作模型70 1.9k+6
47SimpleHTR基于TensorFlow的手写文字识别系统70 2.2k
48face.evoLVe高性能人脸识别开源库70 3.6k
49deep-text-recognition-benchmark深度学习文字识别基准测试框架70 3.9k+1
50tesserocrTesseract OCR的Python封装库70 2.2k+1
51VLM_survey视觉语言模型研究资源合集69 3.1k
52InternLM-XComposer多模态大模型,支持长时流式视频音频交互69 2.9k
53awesome-segment-anythingSegment Anything相关资源合集69 1.7k
54AdvancedLiterateMachinery阿里OCR团队的文字识别与文档理解项目合集69 1.8k
55CHINESE-OCR中文场景文字检测与不定长OCR识别69 3.0k
56InternGPT开源多模态AI模型演示平台69 3.2k+3
57LLaVA-OneVision-2开放的多模态大模型训练框架69 1.2k+11
58tools-ocr跨平台树洞OCR文字识别小工具69 3.1k
59DeTikZify将科学图表转为TikZ绘图代码69 1.8k+2
60TrWebOCR开源中文离线OCR,识别率媲美大厂69 2.9k

展示前 60 名 · 完整榜单见 每日热榜 →

SKILL·STUDY · 夜市每 10 分钟补货一次 · 排名公正性政策SKILL.STUDYS·96README 徽章 · 一键佩戴本夜市靈感來自 士林 · 寧夏 · 饒河