LIVESSI 79,365.00▲0.01%
未登录 · 登录

大厅 / 国内 / 多模态视觉

多模态视觉

VISION · CHINA

收录 162今日新增 0数据源 GitHub 每日快照

多模态视觉(国内)分类当前收录 162 AI Skill,按 S-Score 排名靠前的有 PaddleOCR(S·91)Umi-OCR(S·83)ddddocr(S·80)。S-Score 基于 GitHub 星标量级与维护活跃度算法计算,每小时重排、付费不影响排名,数据每日快照。

本榜单每小时重排 · 方法论
1PaddleOCR百度飞桨 OCR 工具箱,把 PDF/图片变成 AI 可用的结构化数据91 86.4k+469
2Umi-OCR免费开源离线 OCR 识别软件83 46.3k+93
3ddddocr通用验证码识别OCR的Python库80 14.5k+36
4minimind-v2小时从零训练65M参数视觉多模态VLM78 8.4k+34
5JanusDeepSeek Janus:统一多模态理解与生成模型78 17.8k+1
6GroundingDINO用文字框选图中目标,开放词汇检测75 10.5k+38
广告位招商中 —— 你的产品出现在这里自助投放 · 周结算 · 广告内容与榜单排序无关了解 →广告 AD
7InternVL性能对标GPT-4o的开源多模态对话模型75 10.1k+6
8Ask-Anything支持视频理解的类ChatGPT多模态应用73 3.3k+2
9Qwen-VL阿里通义千问视觉语言模型官方仓库73 6.7k+5
10InternVideo视频基础模型,支持多模态视频理解72 2.3k+4
11DeepSeek-VLDeepSeek视觉语言模型,面向真实场景图文理解71 4.1k+3
12CHINESE-OCR中文场景文字检测与不定长OCR识别69 3.0k
13TrWebOCR开源中文离线OCR,识别率媲美大厂69 2.9k
14tools-ocr跨平台树洞OCR文字识别小工具69 3.1k
15InternGPT开源多模态AI模型演示平台69 3.2k+3
16InternLM-XComposer多模态大模型,支持长时流式视频音频交互69 2.9k
17VisCPM基于CPM的中英双语多模态大模型,兼具对话与绘画64 1.1k
18XrayGLM首个中文胸部X光多模态医学大模型64 1.1k
19ARIS-in-AI-OfferBilingual (中文+EN) ML / LLM / diffusion / agent interview cheat sheets for AI 秋招 — generated by ARIS /interview-cheatsheet, rendered by /rend631 328+23
20Multi-Modality-Arena多模态视觉语言模型横向对比竞技场60 566+2
21Visual-Chinese-LLaMA-Alpaca多模态中文LLaMA与Alpaca大语言模型59 461
SKILL·STUDY · 夜市每 10 分钟补货一次 · 排名公正性政策SKILL.STUDYS·96README 徽章 · 一键佩戴本夜市靈感來自 士林 · 寧夏 · 饒河