PDFはまず印刷形式です。一部のPDFは選択できる中国語テキストを含みます。ほかはページの写真です。変換は、ファイル内にテキストとして存在する字だけを変えられます。その一つの事実が、このツールが助けられるかを決めます。
ChineseDocConverterはPDFのアップロードを受け取り、OpenCC変換のためにテキストを取り出し、ダウンロード用の変換済みファイルを作ります。テキストベースのPDFは妥当な候補です。本のページのスキャンは、誰かが画像をテキストに変えるまで、字形変換の問題ではありません。
テキストPDF対スキャン
文をハイライトしてメモ帳にコピーできるなら、PDFはおそらくテキストを持ちます。ハイライトが点の矩形を選ぶか、何も選ばないなら、先にOCRが必要です。このサイトはOCRエンジンとして宣伝していません。
三番目の事例はテキストに見えてなお失敗します。グリフが輪郭にされたか、埋め込みフォントが使えるUnicodeとして取り出せないサブセットです。空の出力または散らばった字が見えます。リーダーでPDFを開き、段落をコピーするのが最も安いテストです。コピーがすでに誤っているなら、変換は直せません。文字化けした中国語をご覧ください。
フォントと、「成功した」変換のあとに四角が現れる理由
テキストが存在しても、PDFは簡体字だけ、または繁体字のグリフだけを覆うフォントを埋め込むことがあります。変換のあと、他方のセットを含むフォントが必要になることがあります。國を描けないビューアは、ファイルが今正しい符号点を持っていても四角を示します。それは中国語フォントとUnicodeで扱います。
PDFは位置も固定します。繁体字はしばしば広いです。元のフォントに収まった行が、変換後に罫線やロゴと重なることがあります。それはレイアウトの確認であり、OpenCCが失敗した証拠ではありません。
再構築したファイルが保てることと保てないこと
コンバーターは、変換したテキストを元の位置の近くに戻し、ページサイズを保つことを目指します。画素同一のパンフレットは約束できません。複雑なデザインファイル — 雑誌、賞状、狭い欄の用紙 — が最悪の適合です。本文が流れる報告書のほうがよい適合です。
注釈、記入済みのフォーム欄、画像の中のテキストは見逃しやすいです。ダウンロードしたあと、最初の三ページと、スタンプや署名欄がある任意のページを歩いてください。
実務の作業手順
- PDFにコピーできる中国語があることを確認する。
- 読者を決め、簡体字から繁体字へ、繁体字から簡体字へ、または地域タイプを選ぶ。OpenCCの変換タイプをご覧ください。
- 文書コンバーターにアップロードする。
- 最初のページ、見出し、表のあるページを確認する。
- ファイルが編集可能なままでなければならないなら、Wordの出発点がなお存在するかを尋ねる。DOCXの確認は通常PDFの確認より易しいです。
一段落で台湾対香港を試すことだけが必要なら、先にその段落をテキストコンバーターにコピーしてください。200ページのスキャンを誤った行き先に通さないでください。
止まって道具を変えるとき
- PDFがスキャン:OCRを使い、それから変換する。
- PDFがなお持っているスライドデッキの書き出し: PowerPointファイルを変換する。
- PDFがExcelの印刷: ブックを変換する。
- 法的品質のレイアウトが必要:変換し、それからデザイナーに再構築してもらうか、元のレイアウトファイルを変換する。
よくある質問
一部のページだけが変わったのはなぜですか? 変わっていないページは画像であるか、異なるフォントサブセットを使っていることがあります。
パスワード保護されたPDFを変換できますか? ファイルが読めないならできません。信頼するツールで保護を外し、それからアップロードしてください。
ブックマークとリンクは生き残りますか? 確認するものとして扱ってください。本文の変換が保証された仕事です。
変換したPDFはよい保管庫ですか? いいえ。元を残してください。変換は一つの版です。
より高品質なスキャンは助けますか? OCRを助けます。OCRがテキストを作るまで、このコンバーターは助けません。