Berkeley Protocol on Digital Open Source Investigations — офіційний стандарт ООН (документ ST/HR/PUB/20/2), за яким МКС, ЄСПЛ і національні суди оцінюють OSINT-докази у 2026 році. Українською не перекладено. Розбираємо простою мовою: 5 базових принципів, 4 стовпи ланцюга зберігання, 9-крокова методологія роботи документатора, застосування у справах МКС проти Аль-Верфаллі, Путіна, Al Hassan. З конкретними прикладами SHA-256-хешування, шаблонами звітів і поясненням, чому без цього стандарту ваша робота залишається журналістикою, а не юридичним доказом.
Швидкий старт
Tesseract OCR — провідний безкоштовний open-source движок для розпізнавання тексту з зображень і сканованих документів. Створений у Hewlett-Packard у 1985 році, підтримувався Google (2006-2018), зараз — спільнотою. Версія 5 (з 2021) використовує LSTM-нейромережі і досягає 99%+ точності для якісного друкованого тексту. Підтримує 100+ мов, включно з українською (ukr). Працює офлайн — критично важливо для конфіденційних юридичних документів.
Доступ
🔓 Повністю безкоштовно, open-source (Apache 2.0)
Офіційний сайт: tesseract-ocr.github.io/tessdoc
GitHub: github.com/tesseract-ocr/tesseract
Розробник: спільнота (originally HP 1985 → Google 2006-2018 → community 2018+)
Поточна стабільна версія: 5.x (з 30 листопада 2021)
Платформи: Linux, macOS, Windows, Android
Тип: command-line інструмент + API через wrappers
Ліцензія: Apache 2.0
📋 Підтримка форматів:
- Вхід: TIFF, JPEG, PNG, BMP, GIF, PDF (через додаткові утиліти)
- Вихід: TXT, HTML, PDF (searchable), TSV, hOCR
📋 Wrappers і інтеграції:
- pytesseract (Python) — найпопулярніший wrapper
- tesseract.js (JavaScript) — для веб-застосунків
- node-tesseract-ocr (Node.js)
- OCRFeeder — GUI для Linux/GNOME
- gImageReader — cross-platform GUI
Мовні моделі для адвокатів
📋 Ключові мовні пакети:
- ukr — українська (стандартна модель)
- rus — російська (часто потрібна для документів радянської епохи)
- eng — англійська
- deu, fra, ita, spa, pol — німецька, французька, італійська, іспанська, польська (для міжнародних справ)
- chi_sim, chi_tra — китайська (для справ з китайським елементом)
- ukr_best, eng_best, rus_best — кращі моделі (LSTM-only, точніші)
📋 Точність 2026:
- Друкований текст високої якості: 99%+
- Якісний скан українського тексту: 95-98%
- Сканований з пожовтілого паперу (старий): 85-92%
- Рукописний текст: 60-80% (значно гірше за AI-альтернативи)
- Низькоякісне фото з телефону: 75-90% (потрібен preprocessing)
Як це працює (5 кроків)
Через командний рядок (рекомендовано для адвокатів)
- Встановити Tesseract (Windows installer від UB Mannheim, Linux:
apt install tesseract-ocr tesseract-ocr-ukr) - Підготувати зображення (TIFF, JPG, PNG) — бажано в 300 DPI
- Виконати у терміналі:
tesseract document.jpg output -l ukr(для української) - Отримати output.txt з розпізнаним текстом
- Для PDF з searchable text:
tesseract document.jpg output -l ukr pdf
Через pytesseract (Python — для масової обробки)
pip install pytesseract pillow- Базовий скрипт:
import pytesseract from PIL import Image text = pytesseract.image_to_string(Image.open('document.jpg'), lang='ukr') - Batch-обробка декількох документів через цикл
- Зберегти результати у CSV/JSON
Через GUI (для нетехнічних користувачів)
- Встановити gImageReader (Windows/Linux/macOS) або OCRFeeder (Linux)
- Відкрити документ → вибрати мову (ukr)
- Натиснути «Розпізнати» → отримати текст
Типові кейси для адвоката
🎯 Кейс 1: Витяг тексту зі сканованого договору для пошуку умов
Клієнт пред’явив скан-копію договору 50+ сторінок. Через Tesseract: tesseract contract.pdf output -l ukr → отримуємо повний текст у TXT. Тепер можна швидко знайти конкретні умови через пошук. Економія часу — десятки годин.
🎯 Кейс 2: OCR заповіту для спадкової справи
У спадковій справі є скан рукопису заповіту. Через Tesseract: запускаємо OCR з українською моделлю → отримуємо ~85% точний текст. Для повної автентифікації — обов’язково почеркознавча експертиза (ст. 242 КПК), але OCR дає попереднє розуміння змісту.
🎯 Кейс 3: Масова обробка документів due diligence
Для корпоративного клієнта потрібно обробити 500 скан-копій документів. Через pytesseract + Python-скрипт: автоматизуємо обробку всіх документів → отримуємо текстові версії для AI-аналізу через Harvey AI або Casetext CoCounsel.
🎯 Кейс 4: OCR судових рішень з ЄДРСР
Клієнт надав фотокопії судових рішень з ЄДРСР. Через Tesseract з українською моделлю: отримуємо текстові версії для порівняння з офіційними версіями в реєстрі. Перевіряємо автентичність копій.
Сильні і слабкі сторони
✅ Сильні:
- Повністю безкоштовно і open-source (Apache 2.0)
- Підтримка 100+ мов — включно з українською (ukr)
- Offline-обробка — критично для конфіденційних справ
- 99%+ точність для якісного друкованого тексту
- Безкоштовний для комерційного використання
- Cross-platform (Windows, macOS, Linux, Android)
- Інтеграція з Python, JavaScript, Node.js
- Searchable PDF output — для архівації документів
- LSTM neural networks — сучасна архітектура (з v4)
- Активна спільнота і регулярні оновлення
⚠️ Слабкі:
- Потребує командного рядка — складно для нетехнічних користувачів
- Препроцесинг важливий — низькоякісні фото дають погані результати
- Рукописний текст — слабкі результати порівняно з AI-альтернативами
- Не виявляє структуру документа (таблиці часто розпізнаються неправильно)
- Layout analysis обмежений (потрібен OCRopus для складних layout)
- AI-driven альтернативи (Doxis, Klippa, IronOCR) часто точніші для бізнес-документів
- Не має вбудованого GUI — потрібні сторонні (gImageReader, OCRFeeder)
- Скани з пожовтілого паперу — потребує preprocessing
- Українські діакритичні знаки іноді розпізнаються неточно (особливо «і», «ї», «є»)
Як використовувати в суді / для адвокатського запиту
📋 Як доказ у суді:
- OCR-результат — це матеріал попереднього дослідження, а не доказ автентичності
- Для остаточного підтвердження — обов’язкова документально-почеркознавча експертиза (ст. 242 КПК)
- Скриншот команди + результат — для долучення до матеріалів справи
- Особливо корисно для великих обсягів документів як preprocessing для AI-аналізу
📋 Адвокатський запит (ст. 24 Закону «Про адвокатуру»):
- Запит до МВС (НДЦ — Науково-дослідний центр експертизи) для документально-почеркознавчої експертизи
- Запит про призначення технічної експертизи документів (ст. 242 КПК)
- Запит до КНДІСЕ (Київський НДІ судових експертиз)
📋 Юридичні підстави:
- Закон «Про судову експертизу» (Україна)
- Стаття 242 КПК — призначення експертизи
- Стаття 102 ЦПК — види доказів (висновки експертів)
- Стаття 84 КПК — доказування у кримінальному провадженні
- Стаття 358 КК — підробка документів
- Стаття 24 Закону «Про адвокатуру»
⚠️ Особливо важливо: Tesseract — це інструмент для попередньої обробки, а не остаточний доказ. Для юридичної автентифікації документа — обов’язково технічна експертиза документів або почеркознавча експертиза від акредитованого експерта (НДЦ МВС, КНДІСЕ, НДЕКЦ).
Альтернативи у каталозі
- ABBYY FineReader — комерційний стандарт OCR з найкращою точністю для української
- Apache Tika — універсальний витяг тексту з 1000+ форматів
Інші OCR-інструменти (поза каталогом):
- Google Cloud Vision OCR — комерційний API від Google
- AWS Textract — від Amazon (для документів з таблицями)
- Microsoft Azure OCR — для бізнесу
- OCR.space — безкоштовний веб-сервіс (з обмеженнями)
- EasyOCR — Python alternative з кращою підтримкою AI
- PaddleOCR — від Baidu, особливо сильний для китайської
- Klippa AI OCR — для бізнес-документів з AI-enrichment
- Doxis AI.dp — комерційний з compliance-перевірками
Корисні посилання
🔗 tesseract-ocr.github.io/tessdoc — офіційна документація
🔗 github.com/tesseract-ocr/tesseract — GitHub репозиторій
🔗 github.com/UB-Mannheim/tesseract/wiki — Windows installer (UB Mannheim)
🔗 github.com/madmaze/pytesseract — pytesseract (Python wrapper)
🔗 github.com/tesseract-ocr/tessdata_best — кращі мовні моделі (включно з ukr_best)
