PDFMove
PDF'i Markdown'a Dönüştürme Nasıl Yapılır? Başlık ve Yapı Koruma
Nasıl Yapılır

PDF'i Markdown'a Dönüştürme Nasıl Yapılır? Başlık ve Yapı Koruma

6 dk okuma

Elinizde bir PDF var ve içeriğini yeniden kullanmanız gerekiyor: bir web sitesine taşımak, sürüm kontrolünde tutmak, güncelleyip yeniden yayınlamak veya başka formatlara dönüştürmek. Markdown, bu iş için iyi bir ara format — düz metin olduğu için esnek, ama başlık ve bağlantı gibi yapıyı da koruyor.

Markdown neden iyi bir hedef

Düz metindir. Herhangi bir editörde açılır, sürüm kontrol sistemlerinde satır satır fark alınabilir, arama ve toplu değiştirme kolaydır.

Yapı taşır. Başlık seviyeleri, listeler, kalın/italik vurgular, bağlantılar, kod blokları ve tablolar — hepsi basit işaretlerle ifade edilir.

Kolayca dönüştürülür. Markdown'dan HTML, Word, PDF, sunum ve daha fazlasına dönüşüm için olgun araçlar vardır.

Statik site üreticileriyle uyumludur. Blog ve dokümantasyon sistemlerinin çoğu doğrudan Markdown okur.

Adım 1: PDF'inizin dönüşüme uygun olup olmadığını kontrol edin

Her PDF eşit derecede iyi dönüşmez. İki şeyi kontrol edin.

Metin katmanı var mı?

PDF'i açın ve bir paragrafı fareyle seçmeye çalışın. Metin seçilebiliyorsa metin katmanı var demektir; seçilemiyorsa sayfa bir görüntüden ibarettir.

Taranmış belgelerde metin katmanı yoktur ve dönüştürücünün çıkaracağı bir şey bulunmaz. Önce OCR uygulamanız gerekir.

OCR sonrası dönüşüm çalışır ama beklentiyi düşük tutun: OCR ile eklenen metin katmanında yazı tipi ve boyut bilgisi yapaydır, dolayısıyla başlık tespiti gibi yapısal çıkarımlar zayıf olur.

Düzen ne kadar karmaşık?

| Düzen | Dönüşüm kalitesi | |---|---| | Tek sütun, düz metin | Çok iyi | | Başlıklı rapor | İyi | | Basit tablolar | İyi | | İki sütunlu düzen | Zayıf, sıra karışabilir | | Kenar notları, kutular | Zayıf | | Karmaşık tablolar | Zayıf | | Dergi/broşür tasarımı | Kötü |

Çok sütunlu düzenler en büyük sorundur: dönüştürücü metnin okuma sırasını konum bilgisinden tahmin etmek zorundadır ve iki sütunlu bir sayfada satırları yatay olarak soldan sağa okuyup iki sütunun metnini iç içe geçirebilir.

Adım 2: Dönüştürün

PDF'ten Markdown'a dönüştürme aracını açın ve dosyanızı yükleyin. İşlem tarayıcınızda çalışır; belgeniz sunucuya gitmez.

Dönüştürücünün yaptığı iş, PDF'in çizim komutlarından anlamsal yapı çıkarmaktır:

  • Metin parçalarını satırlara ve paragraflara gruplandırır.
  • Yazı tipi boyutu ve kalınlığına bakarak başlık seviyelerini tahmin eder.
  • Madde işaretlerini ve numaraları tespit edip liste yapar.
  • Bağlantı açıklamalarını Markdown bağlantılarına çevirir.
  • Tablo yapılarını tespit etmeye çalışır.

Bu adımların çoğu çıkarımdır, dolayısıyla sonuç mükemmel değil "iyi bir başlangıç noktası" olacaktır.

Adım 3: Çıktıyı gözden geçirin

Dönüşmüş Markdown'ı bir editörde açın ve şu sırayla kontrol edin.

Başlık hiyerarşisi

En sık düzeltme gereken yer burası. Kontrol edin:

  • Başlıklar doğru seviyede mi? (# H1, ## H2, ### H3)
  • Seviyeler atlanmış mı? (H1'den doğrudan H3'e geçiş)
  • Kalın yazılmış vurgu cümleleri yanlışlıkla başlık olmuş mu?
  • Gerçek başlıklar atlanmış mı?

Düzeltme kolaydır — sadece # sayısını değiştirirsiniz — ama önce baştan sona bir okuma gerekir.

Paragraf bütünlüğü

PDF'te bir paragraf birden çok satıra bölünmüştür ve dönüştürücü bunları birleştirmelidir. Sorunlar:

Satır sonu tirelemesi. Sayfa düzeninde tireyle bölünmüş kelimeler ("ka-lite") Markdown'da birleşmemiş kalabilir. Metinde arayıp düzeltin.

Erken paragraf bölünmesi. Bir paragraf ortadan ikiye ayrılmış olabilir.

Sayfa geçişleri. Bir paragraf iki sayfaya yayılmışsa, arada sayfa numarası veya altbilgi metni sıkışmış olabilir.

Üstbilgi, altbilgi ve sayfa numaraları

PDF'lerde her sayfanın üstünde ve altında tekrarlayan öğeler bulunur: belge başlığı, bölüm adı, sayfa numarası, telif notu.

Dönüştürücü bunları içerik sanıp Markdown'a dahil edebilir. Sonuç, her birkaç paragrafta bir tekrarlayan "Yıllık Rapor 2025 | 47" gibi satırlardır.

Temizlik: bu satırlar düzenli tekrarladığı için bir metin editöründe "tümünü değiştir" ile veya düzenli ifadeyle toplu silinebilir.

Listeler

Madde işaretli ve numaralı listeler genellikle iyi aktarılır. Kontrol edilecekler:

  • İç içe listelerin girinti seviyeleri doğru mu?
  • Numaralı listeler doğru numaralarla mı başlıyor?
  • Bazı maddeler paragraf olarak mı çıkmış?

Tablolar

Markdown'ın tablo sözdizimi basittir ve sınırları vardır:

| Başlık 1 | Başlık 2 |
|---|---|
| Hücre | Hücre |

Bu yapı düz bir ızgara varsayar. Şunları ifade edemez:

  • Birleştirilmiş hücreler (colspan/rowspan)
  • İç içe tablolar
  • Hücre içinde çok satırlı biçimlendirme
  • Hücre hizalama dışında stil

Basit tablolar genellikle iyi aktarılır. Karmaşık olanlarda iki seçeneğiniz var: elle sadeleştirmek veya o tabloyu HTML olarak yazmak (çoğu Markdown işleyicisi HTML'i geçirir).

Bağlantılar

Web adreslerine giden köprüler genellikle korunur:

[bağlantı metni](https://ornek.com)

Belge içi bağlantılar ise anlamını kaybeder — Markdown'da sayfa kavramı yoktur. Bunları başlık bağlantılarına (#basliga-git) dönüştürmek gerekir.

Görseller

Görsellerin davranışı araca göre değişir:

  • Bazı araçlar görselleri ayrı dosyalar olarak çıkarıp Markdown'da referans verir.
  • Bazıları görselleri atlar ve sadece bir yer tutucu bırakır.
  • Bazıları base64 olarak gömer (dosyayı çok büyütür).

Görseller önemliyse ayrı bir görsel çıkarma işlemi yapıp elle yerleştirmeniz gerekebilir.

Adım 4: Temizlik ve düzenleme

Dönüşüm sonrası tipik temizlik listesi:

  1. Üstbilgi/altbilgi tekrarlarını silin. Toplu değiştirme ile hızlı yapılır.
  2. Başlık seviyelerini düzeltin. Hiyerarşiyi mantıklı hâle getirin.
  3. Tireli kelimeleri birleştirin. "ka-\nlite" → "kalite".
  4. Gereksiz satır sonlarını temizleyin. Paragraf içi bölünmeler.
  5. Tabloları gözden geçirin.
  6. Bağlantıları test edin.
  7. Görsel referanslarını düzeltin.

Bir editörde önizleme yaparak çalışmak işi kolaylaştırır — çoğu Markdown editörü yan yana kaynak ve önizleme gösterir.

Ne zaman Markdown doğru hedef değil

Görsel tasarım önemliyse. Markdown, düzen ve tasarım taşımaz. Bir broşürün veya dergi sayfasının görsel kimliği tamamen kaybolur.

Karmaşık tablolar merkezdeyse. Markdown'ın tablo desteği sınırlıdır.

Belge sadece okunacaksa. PDF zaten okunabilir bir formattır. Dönüşüm, içeriği yeniden kullanmak istediğinizde anlamlıdır.

Formüller ve özel notasyonlar varsa. Matematiksel formüller PDF'te çizim olarak durur; Markdown'a düz metin olarak gelir ve anlamsızlaşır. LaTeX desteği olan bir Markdown lehçesi kullanıyorsanız formülleri elle yeniden yazmanız gerekir.

Yaygın kullanım senaryoları

Dokümantasyon taşıma. Eski bir kullanım kılavuzu PDF olarak duruyor ve modern bir dokümantasyon sitesine taşınacak. Markdown, statik site üreticilerinin doğal formatıdır.

İçerik yeniden yayınlama. Bir raporu blog yazısına dönüştürmek.

Sürüm kontrolüne alma. Bir belgenin değişikliklerini takip etmek istiyorsanız, PDF ikili bir dosyadır ve fark alınamaz. Markdown düz metindir ve her değişiklik satır satır görünür.

Çoklu format üretimi. Tek bir Markdown kaynağından HTML, PDF, Word ve EPUB üretebilirsiniz.

Yapay zeka araçlarına besleme. Markdown, yapısı korunmuş düz metin olduğu için dil modelleriyle çalışırken ham PDF'ten daha iyi bir girdi olur.

Özetle

PDF'ten Markdown'a dönüşüm, çizim komutlarından anlamsal yapı çıkarma işidir ve bu çıkarım tahmine dayalıdır. Tek sütunlu, düzenli belgelerde sonuç iyi olur; çok sütunlu düzenlerde, karmaşık tablolarda ve tasarım ağırlıklı sayfalarda zayıflar. Taranmış PDF'lerde önce OCR gerekir. Dönüşümü bir bitiş değil bir başlangıç noktası olarak görün: başlık seviyelerini düzeltmek, tekrarlayan üstbilgi/altbilgi satırlarını temizlemek, tireli kelimeleri birleştirmek ve tabloları gözden geçirmek standart temizlik adımlarıdır. Sonuçta elinizde sürüm kontrolüne alınabilen, kolayca düzenlenebilen ve pek çok formata dönüştürülebilen esnek bir kaynak olur.

Sıkça Sorulan Sorular

Taranmış bir PDF'i Markdown'a çevirebilir miyim?

Doğrudan çeviremezsiniz. Taranmış PDF'lerde sayfa bir görüntüden ibarettir ve metin katmanı bulunmaz; dönüştürücünün çıkaracağı bir metin yoktur. Önce OCR uygulayıp metin katmanı eklemeniz gerekir. OCR sonrası dönüşüm çalışır ama başlık tespiti gibi yapısal çıkarımlar, doğal metin katmanı olan PDF'lere göre daha zayıf olur.

Başlıklar neden bazen yanlış seviyede çıkıyor?

Çünkü PDF'te 'bu bir başlıktır' bilgisi çoğu zaman yazılı değildir. Dönüştürücü, yazı tipi boyutuna, kalınlığa ve konuma bakarak tahmin yapar. Belgede beş farklı punto varsa bunları H1'den H5'e eşlemeye çalışır. Kalın yazılmış bir vurgu cümlesi başlık sanılabilir veya küçük puntolu bir alt başlık atlanabilir. Etiketli (tagged) PDF'lerde bu tahmin gereği ortadan kalkar ve sonuç çok daha doğru olur.

Tablolar Markdown'a düzgün aktarılıyor mu?

Basit, düzenli tablolar genellikle aktarılır. Ama birleştirilmiş hücreler, iç içe tablolar ve çok satırlı hücreler Markdown'ın tablo sözdiziminde karşılık bulmaz — Markdown tabloları düz bir ızgara varsayar. Karmaşık tablolarda çıktıyı elle düzeltmeniz veya o tabloyu HTML olarak yazmanız gerekebilir.

Markdown'a çevirmenin ne faydası var?

Markdown düz metindir: sürüm kontrol sistemlerinde fark alınabilir, herhangi bir metin editöründe düzenlenebilir, statik site üreticilerine doğrudan verilebilir ve HTML, Word, PDF gibi çok sayıda formata kolayca dönüştürülebilir. Bir PDF'teki içeriği yeniden kullanmak, güncellemek veya bir web sitesine taşımak istediğinizde Markdown esnek bir ara format sağlar.

Bu konuyu PDF → Markdown aracıyla hemen deneyin.

PDF → Markdown aracını dene