Firecrawl'ın anydoc'una OCR geldi: taranmış belge de artık makine okunur metne dönüyor

MIT lisanslı Rust kütüphanesi 14 belge biçimini Markdown'a çeviriyor. Yeni eklenen OCR ile taranmış sayfalar da giriyor; şirket sayfa başına medyan 190 milisaniye bildiriyor.

Paylaş
Firecrawl'ın anydoc'una OCR geldi: taranmış belge de artık makine okunur metne dönüyor

Firecrawl, açık kaynak belge dönüştürücüsü anydoc'a optik karakter tanıma (OCR) desteği ekledi. Böylece kütüphane yalnızca dijital belgeleri değil, taranmış sayfaları da metne çevirebiliyor.

anydoc, Rust ile yazılmış bir kütüphane ve işi tek cümleyle özetlenebilir: belgeyi alıp temiz Markdown'a çeviriyor. Desteklediği 14 biçim arasında Word, PowerPoint, Excel, OpenDocument, RTF, EPUB, CSV ve PDF var. Çıktı düz metin değil; başlıklar, bağlantılar, listeler, tablolar, dipnotlar ve LaTeX olarak denklemler korunuyor.

Neden önemli: dil modelleri ve ajanlar bir kurumsal arşivi okumak istediğinde ilk engel biçim oluyor. PDF, Word ve tarama karışımı bir klasör, modelin doğrudan sindirebileceği bir şey değil. anydoc bu ara katmanı hallediyor ve Markdown üretiyor; modellerin en rahat çalıştığı biçim.

Şirketin verdiği hız rakamları şöyle: OCR gerektirmeyen belgelerde medyan 4,4 milisaniye, OCR gereken taranmış sayfalarda 190 milisaniye. Düzen algılama, tablo ve formül çıkarımı da OCR tarafında çalışıyor.

Kullanım üç yoldan: komut satırından (npx @firecrawl/anydoc belge.docx -o cikti.md), npm, pip ya da Rust paketi olarak, bir de tarayıcıda çalışan WebAssembly sürümüyle. Kütüphane MIT lisanslı, yani ticari kullanıma açık. OCR tarafı barındırılan bir hizmet olarak Firecrawl Parse üzerinden çalışıyor; şirket kayıt gerektirmediğini, API anahtarının yalnızca limitleri yükselttiğini belirtiyor. Burada önemli bir ayrım var: anydoc yerelde OCR yapmıyor. Taranmış olduğunu tespit ettiği belgeyi; yalnızca onu; Firecrawl Parse'a gönderiyor; geri kalan dönüştürme işi makineden hiç çıkmıyor. Kurumsal arşivde bu ayrım, hangi belgenin dışarı gittiğini bilmek anlamına geliyor.

Yerel OCR yolda. Firecrawl mühendisi Abimael Martell, anydoc ve pdf-inspector'da yerel OCR'ın kullanılabilir olduğunu, hangi sayfaların OCR'a gideceğine karar veren hızlı bir sınıflandırma motoru olduğunu duyurdu. Ancak bu yetenek yayımlanmış sürümde henüz yok: hem npm hem GitHub'daki son sürüm 0.2.4 ve onun notları barındırılan OCR'ı tarif ediyor. Yerel OCR yayımlandığında belge hiç dışarı çıkmadan taranmış sayfa okunabilecek; kurumsal arşivler açısından asıl fark yaratacak adım bu.

Kaynak kod GitHub'da.