Image-to-text AI Models

Models listed

223

Reviewed and live in this category

Worth weighing up

What goes in and out, licence terms, and whether you can host it yourself

How we treat data

Published specs only — we don't estimate numbers a vendor hasn't stated

Image-to-text models are a source-backed task collection in this directory. The current editorial inventory contains 198 mapped model records. Task membership is a discovery signal, not a performance ranking, deployment recommendation, or proof that every checkpoint accepts the same inputs and returns the same outputs.

Start with the model list, then open each record that matches your data, operating constraints, and intended workflow. Check the primary source, documented modalities, license, release information, and implementation notes before using a model in production.

This collection keeps unsupported pricing, availability, and benchmark claims blank. Each page remains outside the public index until an editor approves its content and related model records.

Image-to-text model list

Scan the table below, then open any model for pricing, limits and the full write-up.

223 models
ModelCapabilityContextInput $/1MOutput $/1MSpeed
Gemini 3.5 Flash Lite
Google
89.41.0M$0.30$2.50
Gemini 3.6 Flash
Google
89.41.0M$1.50$7.50
Gemini 3.1 Flash Lite
Google
89.01.0M$0.25$1.50
Gemini 3.5 Flash
Google
89.01.0M$1.50$9.00
Gemini Flash Latest
Google
89.01.0M$1.50$9.00
Gemini Flash-Lite Latest
Google
89.01.0M$0.25$1.50
Deep Research Max Preview
Google
88.91.0M$2.00$12.00
Gemini Deep Research Preview
Google
88.91.0M$2.00$12.00
Gemini 3.1 Flash Lite Preview
Google
88.61.0M$0.25$1.50
Gemini 3.1 Pro Preview
Google
88.51.0M$2.00$12.00
Gemini 3.1 Pro Preview Custom Tools
Google
88.51.0M$2.00$12.00
Gemini 3 Flash Preview
Google
88.21.0M$0.50$3.00
Gemini 3 Pro Preview
Google
88.01.0M$2.00$12.00
Gemini 2.5 Flash
Google
87.21.0M$0.30$2.50
Gemini 2.5 Flash-Lite
Google
87.21.0M$0.10$0.40
Gemini 2.5 Pro
Google
87.21.0M$1.25$10.00
Muse Spark 1.1
Meta
82.01M$1.25$4.25
GPT-5.6 Luna
OpenAI
80.81.1M$0.20$1.20
GPT-5.6 Sol
OpenAI
80.81.1M$5.00$30.00
GPT-5.6 Terra
OpenAI
80.81.1M$2.00$12.00
Kimi K3
Moonshot AI
80.81.0M$3.00$15.00
MiMo-V2.5
Xiaomi
80.41.0M$0.14$0.28
GPT-5.5
OpenAI
80.31.1M$5.00$30.00
GPT-5.5 Pro
OpenAI
80.31.1M$30.00$180.00
GPT-5.4
OpenAI
80.11.1M$2.50$15.00
Qwen3.7 Flash
Alibaba
79.11M$0.03$0.13
Qwen3.6 Flash
Alibaba
78.71M$0.19$1.13
MiMo-V2-Omni
Xiaomi
78.5262.1K$0.14$0.28
Qwen3.6 27B
Alibaba
77.2262.1K$0.60$3.60
Qwen3.6 35B-A3B
Alibaba
77.2262.1K$0.25$1.49
Grok 4.3
xAI
76.91M$1.25$2.50
Qwen3.5 122B-A10B
Alibaba
76.9262.1K$0.40$3.20
Qwen3.5 27B
Alibaba
76.9262.1K$0.30$2.40
Qwen3.5 35B-A3B
Alibaba
76.9262.1K$0.25$2.00
Inkling
Thinkingmachines
76.81.0M$1.00$4.05
Inkling Small
Thinkingmachines
76.81.0M$0.50$1.20
Qwen3.5 397B-A17B
Alibaba
76.8262.1K$0.60$3.60
Grok 4.20 (Reasoning)
xAI
76.71M$1.25$2.50
Fugu
Sakana AI
76.41M
Fugu Ultra
Sakana AI
76.41M$5.00$30.00
GPT-5.5 Instant
OpenAI
75.7400K$5.00$30.00
Qwen3.8 Max
Alibaba
75.71M$2.00$6.00
Claude Opus 5
Anthropic
75.61M$5.00$25.00
Qwen3.8 Max Preview
Alibaba
75.61M$1.50$5.00
Claude Sonnet 5
Anthropic
75.51M$2.00$10.00
Claude Fable 5
Anthropic
75.41M$10.00$50.00
Claude Opus 4.8
Anthropic
75.31M$5.00$25.00
GPT-5.3 Codex
OpenAI
75.3400K$1.75$14.00
Claude Opus 4.7
Anthropic
75.11M$5.00$25.00
GPT-5.2 Codex
OpenAI
75.0400K$1.75$14.00
Kimi K2.7 Code
Moonshot AI
74.9262.1K$0.95$4.00
Kimi K2.7 Code Highspeed
Moonshot AI
74.9262.1K$1.90$8.00
Claude Opus 4.6
Anthropic
74.71M$5.00$25.00
Kimi K2.6
Moonshot AI
74.6262.1K$0.95$4.00
Grok Build 0.1
xAI
74.5256K$1.00$2.00
Kimi K2.5
Moonshot AI
74.0262.1K$0.60$3.00
Gemini Robotics-ER 1.6 Preview
Google
73.8131.1K$1.00$5.00
Qwen3.7 Plus
Alibaba
73.81M$0.50$3.00
Gemini 3.1 Flash Live Preview
Google
73.7131.1K$0.75$4.50
Qwen3.6 Plus
Alibaba
73.51M$0.50$3.00
Qwen3.5 Plus
Alibaba
73.31M$0.40$2.40
Claude Sonnet 4.6
Anthropic
73.21M$3.00$15.00
Grok 4.5
xAI
73.1500K$2.00$6.00
GLM-5V-Turbo
Zhipu AI
72.3200K$5.00$22.00
MiniMax-M3
MiniMax
72.1512K$0.30$1.20
Nemotron 3 Nano Omni 30B A3B Reasoning
NVIDIA
72.1256K$0.00$0.00
Qwen3.5 9B
Alibaba
71.9262.1K$0.04$0.15
GPT-5 Pro
OpenAI
70.6400K$15.00$120.00
GPT-5.4 mini
OpenAI
70.5400K$0.75$4.50
GPT-5.4 nano
OpenAI
70.5400K$0.20$1.25
GPT-5.4 Pro
OpenAI
70.11.1M$30.00$180.00
GPT-5.2
OpenAI
70.0400K$1.75$14.00
GPT-5.1
OpenAI
69.8400K$1.25$10.00
GPT-5.1 Codex
OpenAI
69.8400K$1.25$10.00
GPT-5.1 Codex Max
OpenAI
69.8400K$1.25$10.00
GPT-5.1 Codex mini
OpenAI
69.8400K$0.25$2.00
o3
OpenAI
69.8200K$2.00$8.00
Step 3.7 Flash
StepFun
69.7256K$0.18$1.11
Mistral Medium 3.5
Mistral AI
69.6262.1K$1.50$7.50
Mistral Medium (latest)
Mistral AI
69.6262.1K$1.50$7.50
GPT-5-Codex
OpenAI
69.5400K$1.07$8.50
GPT-5
OpenAI
69.3400K$1.25$10.00
GPT-5 Mini
OpenAI
69.3400K$0.25$2.00
GPT-5 Nano
OpenAI
69.3400K$0.05$0.40
o1
OpenAI
69.0200K$15.00$60.00
GPT-Realtime-2.1
OpenAI
67.6128K$4.00$24.00
Gemini 2.0 Flash
Google
66.61.0M$0.10$0.40
Gemini 2.0 Flash-Lite
Google
66.61.0M$0.07$0.30
Gemma 4 26B A4B IT
Google
65.6262.1K$0.07$0.34
Gemma 4 31B IT
Google
65.6262.1K$0.10$0.34
o3-pro
OpenAI
65.1200K$20.00$80.00
Claude Opus 4.5 (latest)
Anthropic
65.0200K$5.00$25.00
GPT-5.2 Pro
OpenAI
65.0400K$21.00$168.00
Claude Opus 4.5
Anthropic
64.9200K$5.00$25.00
Claude Haiku 4.5
Anthropic
64.8200K$1.00$5.00
Claude Haiku 4.5 (latest)
Anthropic
64.8200K$1.00$5.00
o4-mini
OpenAI
64.8200K$1.10$4.40
Claude Sonnet 4.5
Anthropic
64.7200K$3.00$15.00
Claude Sonnet 4.5 (latest)
Anthropic
64.7200K$3.00$15.00
o1-pro
OpenAI
64.6200K$150.00$600.00
Mistral Small 4
Mistral AI
64.3256K$0.15$0.60
Mistral Small (latest)
Mistral AI
64.3256K$0.15$0.60
Gemma 4 E2B IT
Google
64.2131.1K$0.02$0.10
Gemma 4 E4B IT
Google
64.2131.1K$0.04$0.20
Nemotron Nano 12B v2 VL
NVIDIA
64.2128K$0.20$0.60
Claude Sonnet 4
Anthropic
64.0200K$3.00$15.00
Claude Sonnet 4 (latest)
Anthropic
64.0200K
Command A Plus
Cohere
63.8128K$2.50$10.00
Gemini 1.5 Pro
Google
63.62M$1.25$5.0065 t/s
Claude Sonnet 3.7
Anthropic
63.5200K$3.00$15.00
Claude Opus 4.1
Anthropic
62.9200K$15.00$75.00
Claude Opus 4.1 (latest)
Anthropic
62.9200K$15.00$75.00
Claude Opus 4
Anthropic
62.5200K$15.00$75.00
Claude Opus 4 (latest)
Anthropic
62.5200K
Nano Banana 2
Google
62.5131.1K$0.50$60.00
Grok 4.20 (Non-Reasoning)
xAI
61.71M$1.25$2.50
GLM-4.6V
Zhipu AI
61.5128K$0.30$0.90
GPT-4.1
OpenAI
60.31.0M$2.00$8.00
GPT-4.1 mini
OpenAI
60.31.0M$0.40$1.60
GPT-5.2 Chat
OpenAI
60.0128K$1.75$14.00
GPT-5.1 Chat
OpenAI
59.8128K$1.25$10.00
Qwen3-VL Plus
Alibaba
59.5262.1K$0.20$1.60
GPT-5 Chat (latest)
OpenAI
59.3400K$1.25$10.00
o3-deep-research
OpenAI
58.2200K$9.00$36.00
o4-mini-deep-research
OpenAI
58.2200K$1.80$7.20
Claude 3.5 Sonnet
Anthropic
57.7200K$3.00$15.0078 t/s
Gemini 2.5 Computer Use Preview
Google
57.6128K$1.25$10.00
GLM-4.5V
Zhipu AI
56.064K$0.60$1.80
GPT-4.1 nano
OpenAI
55.31.0M$0.10$0.40
Nano Banana 2
Google
55.265.5K$0.50$60.00
Ornith 1.0 31B
Deepreinforce
55.0262.1K
Ornith 1.0 35B
Deepreinforce
55.0262.1K
Ornith 1.0 397B
Deepreinforce
55.0262.1K
Ornith 1.0 9B
Deepreinforce
55.0262.1K
Nano Banana 2 Lite
Google
54.965.5K$0.25$30.00
Llama 4 Scout 17B Instruct
Meta
51.93.5M$0.18$0.59
Nano Banana Pro
Google
49.265.5K$2.00$120.00
Llama 4 Maverick 17B Instruct
Meta
48.51M$0.27$0.85
Nano Banana Pro
Google
48.165.5K$2.00$120.00
GPT-4o mini
OpenAI
47.2128K$0.15$0.60
GPT-4o
OpenAI
46.8128K$2.50$10.00110 t/s
GPT-4o
OpenAI
46.8128K$2.50$10.00
Mistral Large 3
Mistral AI
46.7262.1K$0.50$1.50
Mistral Large (latest)
Mistral AI
46.7262.1K$0.50$1.50
GPT-5.3 Chat (latest)
OpenAI
45.4128K$1.75$14.00
Nemotron 3.5 Content Safety
NVIDIA
44.4128K
Nano Banana
Google
44.332.8K$0.30$30.00
Claude Haiku 3.5
Anthropic
43.4200K$0.80$4.00
Claude Sonnet 3.5 v2
Anthropic
43.4200K
Mistral Medium 3
Mistral AI
43.4131.1K$0.40$2.00
GPT-4o (2024-11-20)
OpenAI
42.9128K$2.50$10.00
GPT-4o (2024-08-06)
OpenAI
42.3128K$2.50$10.00
Pixtral Large (latest)
Mistral AI
42.2128K$2.00$6.00
Qwen-Omni Turbo
Alibaba
42.132.8K$0.07$0.27
Pixtral 12B
Mistral AI
41.9128K$0.15$0.15
Claude Haiku 3
Anthropic
40.6200K$0.25$1.25
Mistral Small 3.2
Mistral AI
39.0128K$0.10$0.30
GPT-4o (2024-05-13)
OpenAI
38.8128K$5.00$15.00
Lyria 3 Clip Preview
Google
38.7131.1K$0.00$0.00
Sonar Reasoning Pro
Perplexity
38.3128K$2.00$8.00
Qwen2.5-VL 72B Instruct
Alibaba
36.0131.1K$2.80$8.40
Qwen-VL Max
Alibaba
35.2131.1K$0.80$3.20
Qwen-VL Plus
Alibaba
34.9131.1K$0.21$0.63
Lyria 3 Pro Preview
Google
34.2131.1K$0.00$0.00
GPT-4 Turbo
OpenAI
33.3128K$10.00$30.00
Gemini Embedding 2
Google
28.88.2K$0.20$0.00
Command A Vision
Cohere
27.7128K$2.50$10.00
Llama Nemotron Rerank VL 1B v2
NVIDIA
27.6128K$0.00$0.00
Sonar Pro
Perplexity
26.9200K$3.00$15.00
Llama Nemotron Embed VL 1B v2
NVIDIA
19.232.8K$0.00$0.00
Aya Vision 32B
Cohere
15.316K
Aya Vision 8B
Cohere
15.316K
GPT-Image-1.5
OpenAI
13.60
alibaba-damo/mgp-str-base
alibaba-damo
5.0
breezedeus/pix2text-mfr
breezedeus
5.0
facebook/nougat-base
facebook
5.0
facebook/nougat-small
facebook
5.0
google/pix2struct-base
google
5.0
ibm-granite/granite-vision-3.3-2b
ibm-granite
5.0
JEILDLWLRMA/Qwen3-VL-8B-Instruct-NVFP4
JEILDLWLRMA
5.0
kha-white/manga-ocr-base
kha-white
5.0
laion/mscoco_finetuned_CoCa-ViT-L-14-laion2B-s13B-b90k
laion
5.0
lightonai/LightOnOCR-1B-1025
lightonai
5.0
microsoft/git-base
microsoft
5.0
microsoft/kosmos-2-patch14-224
microsoft
5.0
microsoft/trocr-base-handwritten
microsoft
5.0
microsoft/trocr-base-printed
microsoft
5.0
microsoft/trocr-base-stage1
microsoft
5.0
microsoft/trocr-large-handwritten
microsoft
5.0
microsoft/trocr-large-printed
microsoft
5.0
microsoft/trocr-small-handwritten
microsoft
5.0
microsoft/trocr-small-printed
microsoft
5.0
microsoft/trocr-small-stage1
microsoft
5.0
naver-clova-ix/donut-base
naver-clova-ix
5.0
naver-clova-ix/donut-base-finetuned-cord-v2
naver-clova-ix
5.0
nlpconnect/vit-gpt2-image-captioning
nlpconnect
5.0
noctrex/LightOnOCR-2-1B-bbox-soup-GGUF
noctrex
5.0
numind/NuExtract3
numind
5.0
optimum-intel-internal-testing/pix2struct-tiny-random
optimum-intel-internal-testing
5.0
optimum-intel-internal-testing/trocr-small-handwritten
optimum-intel-internal-testing
5.0
PaddlePaddle/en_PP-OCRv4_mobile_rec
PaddlePaddle
5.0
PaddlePaddle/en_PP-OCRv5_mobile_rec
PaddlePaddle
5.0
PaddlePaddle/latin_PP-OCRv5_mobile_rec
PaddlePaddle
5.0
PaddlePaddle/PP-DocBlockLayout
PaddlePaddle
5.0
PaddlePaddle/PP-LCNet_x1_0_doc_ori
PaddlePaddle
5.0
PaddlePaddle/PP-LCNet_x1_0_textline_ori
PaddlePaddle
5.0
PaddlePaddle/PP-OCRv3_mobile_det
PaddlePaddle
5.0
PaddlePaddle/PP-OCRv5_mobile_det
PaddlePaddle
5.0
PaddlePaddle/PP-OCRv5_mobile_det_onnx
PaddlePaddle
5.0
PaddlePaddle/PP-OCRv5_mobile_rec
PaddlePaddle
5.0
PaddlePaddle/PP-OCRv5_server_det
PaddlePaddle
5.0
PaddlePaddle/PP-OCRv5_server_rec
PaddlePaddle
5.0
PaddlePaddle/PP-OCRv6_medium_det
PaddlePaddle
5.0
PaddlePaddle/PP-OCRv6_medium_rec
PaddlePaddle
5.0
PaddlePaddle/UVDoc
PaddlePaddle
5.0
raxtemur/trocr-base-ru
raxtemur
5.0
rtr46/meiki.text.detect.v0
rtr46
5.0
rtr46/meiki.txt.recognition.v0
rtr46
5.0
Salesforce/blip-image-captioning-base
Salesforce
5.0
Salesforce/blip-image-captioning-large
Salesforce
5.0
sherif1313/Arabic-handwritten-OCR-4bit-Qwen2.5-VL-3B-v2
sherif1313
5.0
unsloth/GLM-OCR
unsloth
5.0
zhiyuanyou/DeQA-Score-Mix3
zhiyuanyou
5.0

223 models · click a column to sort

About the capability score: a 0–100 figure SyncDev calculates from each vendor's published specifications — context window, reasoning support, input modalities, tool calling, maximum output and how recently the model shipped. It measures breadth of capability, not benchmark performance, so a higher-scoring model is not automatically the better choice for your task.

Image-to-text model questions

It groups source-backed directory records for research and comparison. Review each model page and its primary documentation because collection membership alone does not prove quality, availability, or suitability.