Berkeley Protocol on Digital Open Source Investigations — офіційний стандарт ООН (документ ST/HR/PUB/20/2), за яким МКС, ЄСПЛ і національні суди оцінюють OSINT-докази у 2026 році. Українською не перекладено. Розбираємо простою мовою: 5 базових принципів, 4 стовпи ланцюга зберігання, 9-крокова методологія роботи документатора, застосування у справах МКС проти Аль-Верфаллі, Путіна, Al Hassan. З конкретними прикладами SHA-256-хешування, шаблонами звітів і поясненням, чому без цього стандарту ваша робота залишається журналістикою, а не юридичним доказом.
Швидкий старт
Apache Tika — потужний безкоштовний інструментарій від Apache Software Foundation для виявлення типу файлу, витягу тексту і метаданих з понад 1000 форматів: PDF, документи Microsoft Office, файли OpenOffice, електронні листи, електронні книги, аудіо/відео, архіви, бази даних, зображення. Працює як бібліотека Java, командний інструмент або локальний веб-сервер. Має вбудовану інтеграцію з Tesseract OCR для розпізнавання тексту зі зображень. Стандарт у пошукових системах (Apache Solr, Elasticsearch) і системах електронного збору доказів (e-discovery) для юридичних компаній.
Доступ
🔓 Повністю безкоштовно, відкритий код (ліцензія Apache 2.0)
Сайт: tika.apache.org
GitHub: github.com/apache/tika
Розробник: Apache Software Foundation
Поточна версія: 4.x (з 2026); попередня — 2.x (стабільна)
Платформи: Linux, macOS, Windows (потрібна Java 11+)
Тип: бібліотека Java + командний інструмент + локальний веб-сервер
Ліцензія: Apache 2.0
📋 Способи використання:
- Tika App (через командний рядок) — для одиничних операцій
- Tika Server (через локальний веб-сервер) — для веб-інтеграції
- Бібліотека для Java — для інтеграції у власні Java-додатки
- Обгортки для інших мов: Python (tika-python), Node.js, R
Підтримувані формати (1000+)
📋 Текстові документи:
- PDF (через бібліотеку Apache PDFBox)
- Microsoft Office: DOC, DOCX, XLS, XLSX, PPT, PPTX (через Apache POI)
- OpenOffice / LibreOffice: ODT, ODS, ODP
- RTF, TXT, CSV (значення розділені комою), TSV (значення розділені табуляцією)
- HTML, XML
📋 Електронна пошта:
- EML (стандартний формат електронної пошти)
- MSG (формат Microsoft Outlook)
- MBOX (поштова скринька)
📋 Електронні книги і архіви:
- EPUB, MOBI, FB2 — електронні книги
- ZIP, TAR, GZ, RAR, 7Z — стиснуті архіви
- SQLite, MS Access — бази даних
📋 Медіа:
- JPEG, PNG, GIF, TIFF, BMP — зображення (з розпізнаванням тексту через Tesseract)
- MP3, WAV, FLAC — аудіо
- MP4, AVI, MOV — відео (метадані)
📋 Спеціалізовані:
- DICOM — медичні зображення
- GIS-формати — географічні дані
- CAD-формати — інженерні креслення
Ключові можливості
📋 Витяг тексту:
- Єдиний інтерфейс для усіх 1000+ форматів
- Структурований витяг (зберігає форматування, таблиці, заголовки)
- Інтеграція з Tesseract OCR — для зображень і сканованих PDF
📋 Виявлення типу файлу:
- За бінарними сигнатурами (так звані magic bytes — перші байти файлу, що визначають його формат)
- За розширенням файлу
- За фактичним вмістом документа
- Виявлення MIME-типу — точне визначення формату (наприклад,
application/pdf)
📋 Витяг метаданих:
- EXIF, IPTC, XMP для зображень
- Метадані OOXML для Microsoft Office (автор, дата створення, програма)
- Метадані PDF (версія PDF, програма-творець, дата створення)
- Заголовки електронних листів (From, To, Subject, Date)
- Метадані аудіо/відео (теги ID3, інформація про кодеки)
📋 Виявлення мови:
- Автоматичне визначення мови тексту
- Підтримка усіх мов, включно з українською
- Корисно для сортування багатомовних документів
Як це працює (5 кроків)
Через командний інструмент Tika App (для одиничних операцій)
- Завантажити tika-app.jar з tika.apache.org/download
- Встановити Java 11 або новішу на комп’ютер
- Виконати:
java -jar tika-app.jar document.pdf→ отримати текст у консолі - Для метаданих:
java -jar tika-app.jar -m document.pdf - Зберегти результат у файл:
java -jar tika-app.jar document.pdf > output.txt
Через локальний веб-сервер Tika Server (для масштабних впроваджень)
- Запустити tika-server.jar:
java -jar tika-server.jar - Сервер запускається на localhost:9998
- Відправити файл через POST-запит → отримати текст або метадані
- Інтеграція з власною системою (електронний збір доказів, пошуковий рушій)
Через обгортку для Python
pip install tika- Базовий скрипт:
from tika import parser parsed = parser.from_file('document.pdf') text = parsed['content'] metadata = parsed['metadata']
Типові кейси для адвоката
🎯 Кейс 1: Витяг тексту з 500+ різноформатних документів
Корпоративний клієнт надав папку з 500 файлами різних форматів (PDF, DOCX, XLSX, електронні листи, ZIP-архіви). Через Tika: запускаємо пакетну обробку → отримуємо єдиний текстовий індекс з усіх документів. Тепер можна швидко знайти будь-яке слово/фразу через пошукову систему (наприклад, Elasticsearch або Solr). Економія тижнів роботи.
🎯 Кейс 2: Аналіз листування електронною поштою у дифамаційній справі
У справі є архів електронних листів (MBOX) з тисячами повідомлень. Через Tika: витягуємо текст і метадані (відправник, отримувач, тема, дата) → передаємо на AI-аналіз для пошуку дифамаційних висловлювань. Підстава для позову про захист гідності і честі (ст. 297 ЦК).
🎯 Кейс 3: Витяг тексту з ZIP-архіву документів
Опонент надав ZIP-архів з кількома десятками PDF, DOCX і фото. Через Tika: автоматично розпаковуємо архів і витягуємо весь текст → отримуємо єдиний текстовий файл для аналізу. Не потрібно вручну відкривати кожен файл.
🎯 Кейс 4: Виявлення підроблених форматів файлів
Опонент стверджує, що файл contract.pdf — це справді PDF. Через Tika: виявлення за бінарними сигнатурами показує, що це DOCX, замаскований під PDF (підроблено розширення файлу). Підстава для відхилення доказу як введення в оману.
Сильні і слабкі сторони
✅ Сильні:
- Повністю безкоштовно і відкритий код (Apache 2.0)
- 1000+ форматів в одному інструменті — найбільший охват у світі
- Єдиний інтерфейс для всіх форматів — економія часу розробників
- Інтеграція з Tesseract OCR — для зображень і сканованих PDF
- Інтеграція з пошуковими системами (Apache Solr, Elasticsearch, Lucene)
- Локальний веб-сервер — для веб-інтеграції
- Обгортки для Python, Node.js, R — для нетехнічних користувачів
- Виявлення підроблених форматів через бінарні сигнатури
- Автоматичне виявлення мови для багатомовних документів
- Локальна обробка — конфіденційність
⚠️ Слабкі:
- Потребує Java 11 або новішу — додаткова залежність
- Написаний на Java — не оптимально для вбудованих систем (хоча є нативні обгортки)
- Швидкість — для дуже великих документів може бути повільним
- Складно для нетехнічних користувачів — командний рядок
- Витяг таблиць обмежений у деяких форматах (для PDF — слабкі результати)
- Якість розпізнавання тексту залежить від Tesseract (95-98% українською)
- Не для аналізу маніпуляцій — лише витяг
- Документація переважно англійською
- Стандартних графічних інтерфейсів немає — потрібно сторонні
Як використовувати в суді / для адвокатського запиту
📋 Як доказ у суді:
- Витягнутий текст з Tika — це матеріал попереднього дослідження, а не доказ автентичності
- Для остаточного підтвердження — обов’язкова технічна експертиза документів (ст. 102 ЦПК, ст. 84 КПК)
- Метадані — додатковий доказ (особливо для виявлення підроблених форматів)
- Особливо корисно для електронного збору доказів і масової обробки документів
📋 Адвокатський запит (ст. 24 Закону «Про адвокатуру»):
- Запит про призначення технічної експертизи документів (ст. 242 КПК)
- Запит до МВС (НДЦ — Науково-дослідний центр експертизи)
- Запит до КНДІСЕ (Київський НДІ судових експертиз)
📋 Юридичні підстави:
- Закон «Про судову експертизу» (Україна)
- Стаття 242 КПК — призначення експертизи
- Стаття 102 ЦПК — види доказів (висновки експертів)
- Стаття 84 КПК — доказування у кримінальному провадженні
- Стаття 358 КК — підробка документів
- Стаття 297 ЦК — захист гідності, честі, ділової репутації
- Стаття 24 Закону «Про адвокатуру»
⚠️ Особливо важливо: Apache Tika — це інструмент для попередньої обробки і масового витягу, а не остаточний доказ. Для юридичної автентифікації документа — обов’язково технічна експертиза документів від акредитованого експерта.
Альтернативи у каталозі
- Tesseract OCR — для розпізнавання тексту зі зображень (Tika використовує саме його)
- ABBYY FineReader — комерційний з кращою точністю розпізнавання
Інші інструменти для витягу тексту (поза каталогом):
- textract (Python) — універсальна обгортка з підтримкою багатьох форматів
- pdfminer.six (Python) — спеціалізація на PDF
- python-docx, openpyxl — для документів Microsoft Office
- mailparser — для електронних листів формату EML
- GROBID — для академічних PDF-документів
- Aspose — комерційна корпоративна альтернатива
- Unstructured.io — сучасна альтернатива для обробки документів через мовні моделі (LLM)
Корисні посилання
🔗 tika.apache.org — головний сайт Apache Tika
🔗 github.com/apache/tika — репозиторій на GitHub
🔗 tika.apache.org/download.html — завантаження
🔗 github.com/chrismattmann/tika-python — обгортка для Python
🔗 github.com/shelfio/tika-text-extract — обгортка для Node.js
