Apa itu OCR Gambar ke Teks?
Ekstrak teks dari gambar, tangkapan layar, dokumen pindai, dan foto menggunakan Tesseract OCR yang berjalan sepenuhnya di perangkat Anda. Mendukung berbagai bahasa dan menghasilkan teks yang bisa diedit untuk disalin atau diunduh. Tidak ada file yang meninggalkan perangkat Anda — semua pemrosesan dilakukan secara lokal.
Alat ini sudah dilengkapi Tesseract OCR yang dikompilasi ke WebAssembly dan 20 paket bahasa terlatih (Inggris, Spanyol, Prancis, Jerman, Italia, Belanda, Portugis, Polandia, Swedia, Turki, Rusia, Arab, Hindi, Thai, Vietnam, Tionghoa Sederhana/Tradisional, Jepang, Korea, Indonesia). Setiap paket diunduh sekali saat pertama dipakai lalu disimpan di cache. Kamu bisa memuat gambar atau PDF satu halaman, memutar foto yang miring, dan memilih satu area sebelum pengenalan, lalu menyimpan hasilnya sebagai teks biasa atau dokumen Word. Akurasinya bagus pada tangkapan layar, hasil pindai 300 dpi, dan struk yang jernih; harapkan 95% atau lebih pada teks cetak, lebih rendah pada tulisan tangan atau foto yang miring.
Cara menggunakan
- Unggah gambar (PNG, JPG, BMP, atau WebP) atau PDF satu halaman yang memuat teks yang ingin diambil, atau tempel tangkapan layar dari papan klip. Baru pertama kali? Tekan Coba Contoh untuk melihatnya bekerja pada sebuah contoh.
- Pilih bahasa teks dalam gambar untuk akurasi pengenalan yang lebih baik. Klik 'Extract Text' untuk memulai pemrosesan OCR.
- Periksa teks hasil ekstraksi, perbaiki kesalahan, lalu salin atau unduh sebagai berkas .txt atau Word (.docx).
Kapan menggunakan
- Mengambil teks yang bisa diedit dari tangkapan layar chat, slide, atau PDF yang melarang salin-tempel.
- Menyalin rincian item dari foto struk kertas ke spreadsheet anggaran rumah tangga.
- Mendigitalkan catatan kuliah tulisan tangan atau cetakan supaya bisa dicari nanti.
Hasil
Unggah foto struk restoran: OCR membaca tiap baris, seperti 'Caesar Salad — $12,50' dan 'Sparkling Water — $3,00', lalu memberi Anda teks bersih untuk ditempel langsung ke spreadsheet.
FAQ
- Bahasa apa saja yang dikenali mesin OCR?
- Inggris, Spanyol, Prancis, Jerman, Italia, Belanda, Portugis, Polandia, Swedia, Turki, Rusia, Arab, Hindi, Thai, Vietnam, Tionghoa Sederhana/Tradisional, Jepang, Korea, dan Indonesia — 20 bahasa seluruhnya. Pilih yang paling dekat dengan gambar. Untuk gambar multibahasa, ambil sistem tulisan yang menutupi bagian terbanyak.
- Seberapa akurat hasil yang bisa diharapkan?
- Pada cetakan bersih 300 dpi atau lebih (tangkapan layar, PDF hasil scan), akurasi umumnya 95% ke atas. Tulisan tangan, kontras rendah, motion blur, atau foto miring akan menurunkannya. Skor kepercayaan di samping hasil menunjukkan seberapa yakin Tesseract.
- Kenapa paket bahasa butuh beberapa detik saat pertama dipakai?
- Setiap model bahasa Tesseract berukuran 10 sampai 20 MB dan diunduh sekali saat pertama kali Anda memilih bahasa itu. Setelah itu disimpan di cache browser, jadi pengenalan berikutnya di bahasa yang sama hampir seketika.
- Bisakah saya menempel tangkapan layar dari clipboard tanpa mengunggah berkas?
- Bisa. Ambil tangkapan layar (Win+Shift+S di Windows atau Cmd+Ctrl+Shift+4 di macOS), lalu klik Tempel Gambar. Alat membaca gambar langsung dari clipboard tanpa perlu menyimpan berkas ke disk.
- Apakah gambar saya dikirim ke server mana pun?
- Tidak. Tesseract berjalan di dalam halaman lewat WebAssembly. Byte gambar tidak meninggalkan perangkat Anda. Untuk membuktikan, matikan jaringan dari DevTools dan lihat bahwa pengenalan tetap selesai.
Alat terkait
Editor Bookmark PDF
Tambah dan edit bookmark di file PDF
Ratakan PDF
Ratakan kolom formulir dan anotasi di file PDF
Editor Teks Kaya
Tulis dan format dokumen dengan editor WYSIWYG
Markdown ke PDF
Konversi file Markdown menjadi dokumen PDF yang tertata rapi
Potong PDF
Potong dan sesuaikan margin halaman PDF
Atur Ulang Halaman PDF
Seret dan lepas untuk mengatur ulang halaman PDF