PDF dosyalarını Markdown'a çevirir; oluşturulan .md dosyaları kaynak PDF ile aynı klasöre kaydedilir. Metin katmanı çıkarımı, basit tablolar ve gömülü figürler için en iyi çabayı gösterir; taranmış sayfalarda otomatik OCR'a geçer. Tüm işlem tarayıcınızda yapılır — dosyalarınız sunucuya gönderilmez.
Hazırlanıyor…0%
—
📥 Hedef klasöre yazma hazır:
Nasıl çalışır?
Metin tabanlı PDF: pdf.js ile sayfa metni okunur; satırlar Y-koordinatına göre yeniden yapılandırılır.
Tablolar: bir satırdaki metin parçaları arasındaki büyük yatay boşluklar sütun sınırı sayılır; ardışık ve eşit sütunlu satırlar GitHub-flavored Markdown tablosuna dönüştürülür (gelişigüzel paragraflar asla tablo olmaz).
Figürler: gömülü raster görseller PNG olarak çıkarılır; küçük simge/logolar (100×100 px altı) atlanır.
Taranmış PDF / görsel sayfa: sayfada yeterli metin yoksa otomatik olarak Tesseract.js OCR'a geçer (Otomatik modda).
"Aynı klasöre yaz": tarayıcı güvenliği gereği site sizin diskinize sessizce yazamaz. 📁 Klasör Seç ile (veya dosya seçiminden sonra) bir klasöre yazma izni verirsiniz; .md ve figürler oraya yazılır.
Tarayıcı uyumluluğu
Chrome / Edge / Opera (Chromium): File System Access API desteklidir — "aynı klasöre yaz" tam çalışır.
Safari / Firefox: diske yazma desteklenmez; 📄 PDF Dosyası Seç kullanılır ve .md dosyaları İndirilenler'e iner (tek dosyaysa .md, birden fazlaysa zip).
İpuçları
OCR ilk açılışta dil paketini indirir (~1-5 MB / dil), sonraki kullanımlarda cache'lenir.
Çok sayfa için 1-5, 8, 12 gibi aralık girin.
Karmaşık, sütun birleştirmeli (colspan) tablolar düz metne düşebilir — bu durumlarda PDF → Excel/CSV aracını deneyin.
Gizlilik
Hiçbir dosya sunucuya gönderilmez. pdf.js + Tesseract.js tarayıcınızda çalışır; klasöre yazma izni yalnızca seçtiğiniz klasör için geçerlidir.