Apa itu PDF ke HTML?
PDF to HTML mengekstrak teks, heading, dan struktur dasar dari file PDF lalu mengubahnya menjadi HTML yang bersih dan semantik. Berguna untuk membuat konten PDF bisa diakses di web, diedit, atau dicari.
Parser memakai pdf.js untuk mengambil potongan teks tiap halaman beserta posisi, ukuran font, dan ketebalannya. Deteksi heading membandingkan ukuran dengan median dokumen dan menaikkan yang menonjol menjadi h1/h2/h3, badan teks jadi tag p, dan jeda paragraf datang dari celah vertikal. Pilih salah satu dari enam mode konversi tergantung kebutuhan: HTML semantik bersih, paragraf polos, salinan SVG yang setia per halaman, atau blok berposisi piksel. Dokumen terenkripsi juga ditangani — kolom kata sandi muncul saat diperlukan.
Cara menggunakan
- Unggah file PDF — alat ini mem-parse setiap halaman dan mengekstrak teks beserta data posisi.
- Tinjau pratinjau HTML yang diekstrak dan sesuaikan opsi format seperti sensitivitas deteksi heading.
- Salin HTML ke clipboard Anda atau unduh sebagai file .html.
Kapan menggunakan
- Memindahkan spesifikasi produk, manual, atau whitepaper dari PDF ke situs dokumentasi.
- Mengubah formulir cetak atau kebijakan menjadi halaman web yang bisa dicari.
- Mengambil teks dari makalah riset untuk dikutip atau diberi anotasi.
Hasil
Seorang developer menerima spesifikasi produk berupa PDF 12 halaman. Mereka mengunggahnya ke sini, mendapatkan HTML bersih dengan heading dan paragraf yang tepat, lalu menempelkannya di wiki proyek agar bisa dirujuk tim.
FAQ
- Apakah gambar atau grafik dari PDF ikut pindah ke HTML?
- Secara bawaan hanya teks yang diekstrak, sehingga gambar tersemat, bagan vektor, dan kolom formulir dilewati. Aktifkan Sematkan gambar halaman, maka setiap halaman dibuat menjadi gambar dan dimasukkan ke HTML, sehingga bagan, grafik, bahkan halaman pindaian ikut tersimpan. Berkas tetap mandiri — tidak ada yang dihosting di tempat lain. Makin tinggi kualitas gambar, makin tajam gambarnya dan makin besar berkasnya.
- Kenapa kadang muncul jeda baris aneh di tengah kalimat?
- Sebagian PDF menyimpan teks dengan hard break per baris, bukan batas paragraf. Matikan Preserve Layout dan konverter akan menyatukan kembali baris menjadi paragraf berdasarkan jarak vertikal. Layout dua kolom juga butuh opsi ini mati.
- Apakah deteksi heading selalu akurat?
- Bekerja baik ketika PDF memakai font lebih besar atau tebal untuk judul, kondisi paling umum. Dokumen yang membedakan judul lewat warna atau posisi tanpa beda ukuran membuatnya tersesat—matikan deteksi dan semua jadi p untuk ditandai manual.
- Apakah HTML hasilnya siap dipublikasikan?
- Output berupa HTML semantik tanpa JavaScript inline, tanpa skrip eksternal, dan tanpa inline style secara default. Tempel ke CMS atau generator situs statis mana pun, balut dengan templat Anda, selesai.
- Bagaimana dengan PDF yang dilindungi kata sandi atau terenkripsi?
- PDF yang dilindungi kata sandi sekarang sudah didukung. Kalau file-nya terenkripsi, setelah diunggah akan muncul kolom kata sandi — isi, lalu dokumen langsung dibuka dan dikonversi di halaman ini. Kata sandi tidak pernah dikirim ke server mana pun.
Alat terkait
Editor Bookmark PDF
Tambah dan edit bookmark di file PDF
Ratakan PDF
Ratakan kolom formulir dan anotasi di file PDF
Editor Teks Kaya
Tulis dan format dokumen dengan editor WYSIWYG
Markdown ke PDF
Konversi file Markdown menjadi dokumen PDF yang tertata rapi
Potong PDF
Potong dan sesuaikan margin halaman PDF
Atur Ulang Halaman PDF
Seret dan lepas untuk mengatur ulang halaman PDF