Powrot do bloga
19 czerwca 2026
published

Mistral OCR - jak wyciągać dane z PDF-ów, skanów i zdjęć w 2026

Kiedyś trafił mi się projekt: firma logistyczna miała 8000 zeskanowanych listów przewozowych w PDF. Każdy z nich trzeba było przepisać do Excela - numer...

Okladka: Mistral OCR - jak wyciągać dane z PDF-ów, skanów i zdjęć w 2026

Kiedyś trafił mi się projekt: firma logistyczna miała 8000 zeskanowanych listów przewozowych w PDF. Każdy z nich trzeba było przepisać do Excela - numer listu, nadawca, odbiorca, waga, data. Koszt u profesjonalnej firmy transkrypcyjnej: ~3000 dolarów i 3 tygodnie czekania. Tesseract (darmowy OCR) poradził sobie z 60% dokładnością - reszta do poprawy ręcznie. Wtedy trafiłem na Mistral OCR, który wtedy właśnie wypuściło francuskie Mistral AI. Te same 8000 dokumentów, ~95% dokładność, koszt kilku dolarów, czas - jedna noc.

W tym artykule pokażę Ci, czym jest Mistral OCR, czym różni się od klasycznego OCR-u, jak go używać i kiedy realnie warto. Plus wady, bo Mistral chętnie chwali się świetnymi benchmarkami, a w praktyce bywa różnie.

Czytanie: ~11 min

Czym jest Mistral OCR (i czym różni się od klasycznego OCR)

Mistral OCR to usługa rozpoznawania tekstu od Mistral AI - francuskiej firmy, która robi modele językowe od 2023 roku. Produkt wypuszczony w marcu 2025 roku, od tamtej pory regularnie aktualizowany.

Klasyczne OCR-y (Tesseract, Abbyy, stare wersje AWS Textract) traktują dokument jak obrazek i próbują znaleźć na nim kształty liter. Działa średnio - zwłaszcza przy tabelach, układach wielokolumnowych, równaniach matematycznych, skanach niskiej jakości.

Mistral OCR podszedł do tego inaczej. To vision-language model - model AI, który rozumie dokument jako całość, nie tylko jako zbiór liter. Widzi, że to faktura. Widzi tabelę. Widzi, że nagłówek jest po lewej, dane po prawej. Rozumie, że "NIP" to pole z numerem, a nie losowy ciąg cyfr.

To różnica fundamentalna. Klasyczny OCR tłumaczy piksele na znaki. Mistral OCR rozumie dokument i tłumaczy go na ustrukturyzowaną treść.

Benchmarki, które podaje Mistral (na moment pisania artykułu):

  • 95%+ dokładność na dokumentach anglojęzycznych
  • 90%+ na polskim, francuskim, hiszpańskim, niemieckim
  • Lepsze radzenie sobie z tabelami i równaniami niż Google Document AI, Azure Document Intelligence, AWS Textract

W praktyce - jak zawsze - wyniki zależą od jakości dokumentów. Czysty PDF z komputera: świetnie. Skan z telefonu przy słabym świetle: bywa różnie.

Jak to działa - od skanu do Markdown

Przekazujesz Mistral OCR dokument (PDF, JPG, PNG). Dostajesz z powrotem tekst - domyślnie w formacie Markdown. To kluczowa decyzja projektowa, warto ją zrozumieć.

Markdown jako format wyjściowy

Inne OCR-y dają Ci czysty tekst albo HTML. Mistral daje Markdown - to znaczy:

# Faktura VAT nr 2026/04/15

**Sprzedawca:** ACME Sp. z o.o.
**Nabywca:** Klient XYZ

| Pozycja | Ilość | Cena | Wartość |
|---------|-------|------|---------|
| Usługa A | 10 | 100 zł | 1000 zł |
| Usługa B | 5 | 200 zł | 1000 zł |

**Razem brutto:** 2460 zł

To jest dokładnie to, co dostajesz z API. Tabele jako tabele Markdown, nagłówki jako nagłówki, formatowanie zachowane. Dla dalszej obróbki (parsing, generowanie JSON, wstawianie do bazy) - zbawienie.

Inne OCR-y dają Ci tekst, który musisz sam parsować, sam rozpoznawać, gdzie jest tabela. Mistral robi to za Ciebie.

Structured output - JSON przez schema

Druga supermoc. Przekazujesz Mistralowi JSON schema - definicję, jakie pola chcesz wyciągnąć. Dostajesz z powrotem czysty JSON.

Przykład schema dla faktury:

{
  "numer_faktury": "string",
  "data_wystawienia": "date",
  "nip_sprzedawcy": "string",
  "nip_nabywcy": "string",
  "pozycje": [
    {
      "nazwa": "string",
      "ilosc": "number",
      "cena_jednostkowa": "number"
    }
  ],
  "kwota_netto": "number",
  "kwota_vat": "number",
  "kwota_brutto": "number"
}

Wrzucasz PDF, dostajesz JSON z wypełnionymi polami. Bez parsowania Markdown-a, bez regex-ów, bez walki z formatami. Wstawiasz prosto do bazy.

Dla zastosowań firmowych (automatyzacja księgowości, ekstrakcja danych z umów, analiza formularzy) - to jest wartość realna.

Multilingual - polski, arabski, azjatyckie

Mistral OCR obsługuje tysiące języków. Oficjalnie deklarowane: 11 z wysoką dokładnością (angielski, francuski, hiszpański, niemiecki, włoski, portugalski, polski, rosyjski, chiński, japoński, arabski), ale realnie radzi sobie z dużo większą liczbą.

Co ważne - polski jest oficjalnie wspierany, nie jest "tag-along language". Dokładność po polsku deklarowana na poziomie 90%+, w moich testach na fakturach i umowach - realnie 88-93%, zależnie od jakości dokumentu.

Dla azjatyckich języków (chiński, japoński, koreański) - Mistral deklaruje jedne z najlepszych wyników na rynku. Dla firm pracujących z dokumentami azjatyckimi - istotne.

Jak używać Mistral OCR - krok po kroku

Najprostsza ścieżka:

  1. Załóż konto na console.mistral.ai. Dostajesz API key.

  2. Dodaj kredyty. Mistral działa w modelu prepaid - doładowujesz konto, płacisz za użycie. Na start wystarczy 10 dolarów.

  3. Wyślij pierwszy request. Najprościej przez curl albo Postman:

curl -X POST https://api.mistral.ai/v1/ocr \
  -H "Authorization: Bearer $API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mistral-ocr-latest",
    "document": {
      "type": "uploaded_file",
      "file_id": "twój_file_id"
    }
  }'
  1. Dostajesz odpowiedź w JSON z Markdown w środku. Parsujesz albo zostawiasz jako Markdown.

  2. (Opcjonalnie) skonfiguruj structured output. Dodajesz response_format ze swoją JSON schema. Dostajesz dane w formacie gotowym do bazy.

  3. Testuj na realnych dokumentach. Nie na 1 sztuce - na 50. Średnia dokładność na 1 dokumencie nic nie znaczy. Na 50 - już wiesz, na czym stoisz.

  4. Wdrazaj w produkcji. Zwykle jako element większego systemu: webhook z maila → Mistral OCR → baza danych → workflow w n8n/Dataverse.

Dla programisty - godzina od zera do działającego prototypu. Dla nietechnicznego użytkownika - potrzebujesz programisty albo narzędzia no-code (Make.com, n8n), żeby zintegrować.

Pięć zastosowań, w których Mistral błyszczy

Po kilku miesiącach pracy z Mistral OCR wyłonił mi się zestaw zastosowań, w których realnie sprawdza się w biznesie.

Automatyzacja księgowości. Faktury przychodzą mailem jako PDF. Wrzucasz do Mistral OCR ze schema "faktura" → dostajesz JSON z numerem, datą, kwotami, pozycjami → wstawiasz do systemu księgowego. Czas przetwarzania: sekundy. Koszt: grosze za stronę.

Analiza umów prawnych. Kancelarie i działy prawne mają setki umów w PDF. Mistral OCR wyciąga klauzule, daty, strony, kwoty - w formacie gotowym do analizy. Porównanie umów - zautomatyzowane.

Przetwarzanie formularzy. Formularze HR, wnioski urlopowe, ankiety - skany lub PDF-y. Mistral wyciąga dane w schema. Eliminuje ręczne przepisywanie.

Archiwizacja historycznych dokumentów. Biblioteki, archiwa, muzea - skany starych dokumentów. Mistral OCR radzi sobie ze starodrukiem, odręcznymi adnotacjami (z różnym skutkiem), wieloma językami w jednym dokumencie.

Ekstrakcja danych z publikacji naukowych. PDF-y z artykułami naukowymi (często wielokolumnowe, z równaniami, tabelami, diagramami). Mistral rozumie strukturę naukową, wyciąga sekcje, cytaty, tabele.

Dla zastosowań DIY (pojedyncze skany do tekstu) - wystarczy darmowy Tesseract albo Google Lens. Dla zastosowań firmowych (setki tysięcy dokumentów, struktura danych) - Mistral OCR ma sens.

Mistral OCR vs Tesseract vs AWS Textract vs Azure - porównanie

Krótkie porównanie najpopularniejszych opcji na rynku:

Mistral OCR. API, vision-language model, Markdown out, JSON schema. Plusy: jakość, szybkość, structured output, multilingual. Minusy: chmurowy (brak lokalnej wersji), krótki na rynku (mniej case studies).

Tesseract. Open-source, darmowy, lokalny. Plusy: cena, prywatność, kontrola. Minusy: niska dokładność na skomplikowanych dokumentach, brak structured output, brak obsługi tabel i równań.

AWS Textract. Dojrzały produkt chmurowy od Amazon. Plusy: integracja z AWS, analityka formularzy, tabele. Minusy: drogi przy dużej skali, droższy od Mistrala, słabszy multilingual.

Azure AI Document Intelligence (dawniej Form Recognizer). Dojrzały produkt Microsoftu. Plusy: integracja z Azure, modele pre-trained dla faktur/ID/receipts. Minusy: cena, złożoność konfiguracji, słabszy multilingual.

Google Document AI. Dojrzały produkt Google. Plusy: integracja z GCP, dobre modele specjalistyczne. Minusy: cena, konfiguracja, słabszy multilingual.

Abbyy FineReader. Komercyjny OCR, desktop-first. Plusy: świetny na desktop, dobrze radzi sobie ze skanami. Minusy: cena, model licencjonowania, nie jest API-first.

Dla kogo Mistral?

  • Masz dużo dokumentów do przetworzenia (>1000 miesięcznie)
  • Potrzebujesz structured output (JSON do bazy)
  • Masz dokumenty w wielu językach (polski, hiszpański, azjatyckie)
  • Cenisz API-first podejście (integracja z kodem/no-code)

Dla kogo coś innego?

  • Budżet zerowy i mała skala - Tesseract
  • Jesteś już w AWS/Azure/GCP - ich OCR-y
  • Desktop-only, kilka dokumentów - Abbyy

Mini case study: masowa ekstrakcja danych z faktur

Firma transportowa, 200 pracowników. Problem: 1500 faktur kosztowych miesięcznie, każda z 5-15 pozycjami, dane do ręcznego wprowadzenia do ERP. Dwie osoby na full-time, dużo błędów.

Wdrożenie Mistral OCR:

  • Webhook: faktura przychodzi mailem → Mistral OCR
  • Schema JSON: numer, data, NIP sprzedawcy/nabywcy, pozycje (nazwa, ilość, cena), kwoty netto/VAT/brutto
  • Walidacja w kodzie (sprawdzenie NIP, suma pozycji = suma końcowa)
  • Jeśli OK - automatyczne wstawienie do ERP
  • Jeśli błąd - Slack notification z prośbą o ręczne sprawdzenie

Pierwszy miesiąc (testy):

  • 1200 faktur z 1500 przetworzonych automatycznie (80%)
  • 300 trafiło do ręcznej weryfikacji (zła jakość skanu, nietypowy układ)
  • Błędy w automatycznych: ~3% (głównie błędny NIP albo data)
  • Koszt API: ~80$ za miesiąc

Po trzech miesiącach (po dostrojeniu schema i jakości skanów):

  • 1400 faktur automatycznie (93%)
  • Koszt API: ~95$
  • Dwie osoby przerzucone na wyższą wartość dodaną (analiza kosztów, negocjacje z dostawcami)

ROI zamknięte w 6 tygodni. Dwie osoby full-time zastąpione przez jeden endpoint API i walidację w kodzie.

Wady i ograniczenia

Żeby nie brzmieć jak ulotka Mistrala, lista rzeczy, które frustrują:

Cena przy bardzo dużej skali. Mimo że tani na start, przy milionach stron miesięcznie koszty rosną. Dla największych graczy opłaca się wytrenować własny model.

Brak lokalnej wersji. Tylko chmura. Dla dokumentów wrażliwych (medycznych, NDA, defense) - problem.

Dokładność na odręcznych notatkach. Świetnie radzi sobie z drukiem. Gorzej z odręcznymi pismami. Odręczne adnotacje na drukowanych dokumentach - bywa różnie.

Halucynacje (rzadkie, ale są). Czasem model "dopowiada" brakujące fragmenty. Zwłaszcza przy fragmentarycznych skanach. Weryfikacja konieczna.

Brak pełnej obsługi diagramów. Tekst, tabele, równania - świetnie. Skomplikowane diagramy z adnotacjami - zwykle jako "obraz nieprzetworzony", trzeba inaczej.

Krótki na rynku. Produkt z 2025 roku. Mniej case studies, mniej społeczności, mniej gotowych integracji niż AWS Textract czy Azure Document Intelligence. Zmienia się szybko, ale na moment pisania - jest to minus.

Interfejs programistyczny tylko. Nie ma ładnego UI do upload-u i weryfikacji. Trzeba programować albo integrować przez no-code (Make, n8n, Zapier).

Mimo tych wad - dla firm, które potrzebują masowo wyciągać dane z dokumentów, Mistral OCR jest dziś najciekawszą nową opcją na rynku.

Bezpieczeństwo i prywatność

Ważna sekcja, bo OCR często przetwarza dokumenty wrażliwe (faktury z NIP, umowy z danymi osobowymi, dokumenty medyczne).

Gdzie idą Twoje dokumenty? Na serwery Mistral AI (chmura, region UE - siedziba w Paryżu). Są tam przetwarzane i zwracane.

Kto ma dostęp? Pracownicy Mistral w określonych sytuacjach (support, compliance). Poza tym - nikt.

Czy używają do trenowania? Mistral deklaruje, że nie używa danych użytkowników z płatnych planów do trenowania modeli. Warto zweryfikować w aktualnej polityce prywatności.

GDPR. Mistral ma siedzibę w UE (Francja), więc podlega GDPR natywnie. Plus dla europejskich firm.

Usuwanie danych. Możesz żądać usunięcia danych po przetworzeniu. Warto to konfigurować automatycznie (po X dniach).

Dla większości zastosowań (faktury, umowy B2B, dokumenty publiczne) - poziom bezpieczeństwa jest akceptowalny. Dla danych high-stakes (medycznych, NDA defense) - konieczna analiza z działem prawnym.

Alternatywa dla pełnej prywatności: Tesseract lokalnie albo własny model open-source (PaddleOCR, docTR). Mniejsza dokładność, ale pełna kontrola.

Ile to kosztuje

Mistral OCR ma prosty pricing - pay-per-page (strona dokumentu). Na moment pisania:

  • Standard pricing: ~0.05$ za stronę (zależnie od modelu)
  • Batch pricing: tańszy przy dużych wolumenach (negocjowany)
  • Structured output: ta sama cena co zwykły OCR

Przykładowe koszty:

  • 100 faktur miesięcznie × średnio 2 strony = 200 stron = ~10$/miesiąc
  • 1000 faktur miesięcznie × 2 strony = 2000 stron = ~100$/miesiąc
  • 10000 faktur miesięcznie × 2 strony = 20000 stron = ~1000$/miesiąc

Porównanie z konkurencją (za 10000 stron):

  • Mistral OCR: ~500-1000$
  • AWS Textract: ~1500-2500$
  • Azure Document Intelligence: ~1500-2000$
  • Google Document AI: ~1500-2500$

Mistral jest zwykle 30-50% tańszy niż konkurencja enterprise. Dla mniejszych graczy - różnica mniejsza (ceny bazowe podobne). Dla dużych - Mistral ma przewagę kosztową.

Kiedy Mistral OCR ma sens, a kiedy nie

Bierz Mistral OCR, jeśli:

  • Masz dużo dokumentów do przetworzenia (100+ miesięcznie)
  • Potrzebujesz structured output (JSON do bazy danych)
  • Masz dokumenty w wielu językach
  • Cenisz API-first podejście
  • Akceptujesz przetwarzanie chmurowe
  • Masz dokumenty w dobrej jakości (druk, czysty skan)

Lepiej szukać czegoś innego, jeśli:

  • Masz bardzo mało dokumentów (<10 miesięcznie) - ręcznie szybciej
  • Wszystkie dokumenty są wrażliwe i nie mogą opuścić infrastruktury (Tesseract lokalnie)
  • Masz dokumenty odręczne (luźne notatki) - Mistral sobie nie poradzi
  • Jesteś w AWS/Azure/GCP i chcesz zostać w ekosystemie - ich OCR-y mają lepszą integrację
  • Potrzebujesz desktop UI (Abbyy FineReader)

Mistral OCR to nie jest OCR do wszystkiego. Ale dla typowego zastosowania firmowego (masowa ekstrakcja danych z dokumentów drukowanych) - jest dziś jednym z najciekawszych wyborów na rynku.

Chcesz wdrożyć OCR w firmie - pomogę

Jeśli czytasz ten artykuł i myślisz "brzmi fajnie, ale nie wiem, jak to wdrożyć u nas" - rozumiem. Wybór OCR to jedno, ale zintegrowanie go z procesami firmowymi (mail → OCR → baza → workflow) to drugie.

Pomagam firmom projektować i wdrażać automatyzacje ekstrakcji danych z dokumentów. Od prostych schematów (faktury do Excela) po pełne systemy (10000+ dokumentów miesięcznie, walidacja, integracje z ERP/CRM, analityka). Pracuję na Mistral OCR, Tesseract, AWS Textract, Azure Document Intelligence - dobieram narzędzie do problemu, nie odwrotnie.

Zaczynamy od audytu: sprawdzamy, gdzie realnie oszczędzisz czas i pieniądze, projektujemy rozwiązanie, wdrażamy i szkolimy zespół. Każde wdrożenie dostosowane do Twojego przypadku, nie ma szablonów.

Jeśli masz proces, który irytuje Cię ręcznym przepisywaniem danych z dokumentów - napisz do mnie przez mwozniczka.net/kontakt. Powiem Ci wprost, czy Mistral OCR (albo coś innego) ma sens dla Twojego przypadku. Bez sprzedaży na siłę, bez combo ofert.