自動変換は速いです。同時に文字どおりです。エンジンは辞書から字(ときどき語)を置き換えます。依頼者、系譜、ブランド指針は知りません。これらは、変換を押したあとに人が最もよく当たる問題です。
どれも「コンバーターを決して使うな」を意味しません。失敗の型を知り、それらの型が集まる場所を校正せよ、という意味です。
一つの簡体字形、複数の繁体字形
后、发、面、干は有名な例です。簡体字では一つの形が、繁体字がなお分ける意味を覆います。コンバーターは辞書と短い文脈窓から選びます。それでも人名、古典の引用、一語の表のセルでは、誤った繁体字を選べます。
これは最も重要な言語上の誤りです。出力が流暢に見えるからです。読者は、人名がよくある副詞に書き直されたことに気づかないことがあります。例と検索一覧は一つの簡体字、複数の繁体字形をご覧ください。
逆方向、繁体字から簡体字へは、分裂を発明する代わりに隠します。よりきれいに感じ、問題として見逃しやすいです。代価はのちに現れます。誰かが簡体字ファイルを戻して変換し、元の繁体字の区別を回復できないときです。
ファイルがすでに壊れていた
出発点が文字化けなら — æのスープ、åのサラダ、または字の代わりの四角 — 変換はめちゃくちゃを増やします。バイトが字のように見えれば、OpenCCは喜んごみを別のみに対応づけます。
先にWordまたはテキストエディタで出発点を開いてください。読める中国語の文をコピーできないなら、止まってください。変換する前に、文字化けしたテキストを直し、本物のUnicodeフォントを確認してください。
関連する罠は、テキストに見えるだけのPDFです。文をハイライトできないなら、ページは絵です。変換はほとんど、または何も有用なものを取り出しません。それはOCRの仕事であり、OpenCCの仕事ではありません。
混在した日本語または韓国語
漢字とハングルの漢字(ハンジャ)は中国語の字に関連して見えます。ドロップインのOpenCC入力ではありません。日本語の新字体簡化は、大陸の簡体字とは異なる歴史をたどりました。中国語コンバーターに通した日本語の段落は、助詞、仮名に隣接する漢字、日本語にしかない語を損なうことがあります。
文書が中国語と日本語を混ぜるなら — 会議プログラム、二言語マニュアル、名の一覧 — 中国語の部分だけを変換するか、ファイルを分けてください。同じ注意は、ハンジャを含む韓国語テキストにも当てはまります。OpenCCの変換タイプは中国語の標準であり、一般的なCJK書き換え器ではありません。
地域語と誤った行き先
台湾の語句テーブルは香港の読者を居心地よくせず、逆もまた真です。出力は読めてもなお「ずれて」いることがあります。イギリスの読者がアメリカの truck と apartment に気づくのと同じです。
これは常に不具合ではありません。誤った変換タイプです。台湾または香港を意図して選んでください。字形だけが必要だったのに言い回しが意外に地元になったなら、語句タイプを誤って選んだのかもしれません。
固有名、ブランド、保護する文字列
コンバーターは「翻訳するな」一覧を知りません。会社名、薬品名、寺の名、または中国語の字を含むローマ字ブランドが変わり得ます。珍しい字を使う人の名も変わり得ます。
大きな仕事の前に、そのままにしなければならない文字列を集めてください。変換のあと、それらを検索してください。繁体字文書の中で簡体字のままにしなければならない文字列、または逆があるなら、自動処理から外し、貼り戻してください。
レイアウト、折り返し、フォント
繁体字はしばしば広いです。簡体字のラベルがぎりぎり収まったスライドのタイトル、ボタン、表計算の列が、溢れ、折り返し、ロゴと衝突することがあります。それはレイアウトの確認であり、常に変換の不具合ではありません。
フォントは二番目の視覚的な誤報を引き起こします。出力フォントに繁体字のグリフが欠けていると、符号点が正しくても四角や代替の形が見えます。行き先標準を覆うフォントをインストールまたは埋め込みしてください。詳細は中国語フォントとUnicodeにあります。
Excelには独自の変種があります。数式は数式のままであるべきです。数式の中のラベルが中国語なら、変換されることがあります。数字に見えるセルの値は変換されるべきではありません。変換後にシートが空に見えるなら、フォントと、出発点のテキストがそもそもテキストとして保存されていたかを見てください。
ファイルの隠れた部分
Wordはテキストをヘッダー、フッター、コメント、脚注、テキストボックス、表に保存します。PowerPointはノートとマスターに保存します。Excelはコメント、シート名、定義名に保存します。本文だけに触れたコンバーターは、二言語のめちゃくちゃを残すでしょう。
ChineseDocConverterは、対応するオフィス形式のそれらの部分を読むように作られています。それでもダウンロードを開き、ヘッダー、ノート、シートタブをたどってください。隠れたテキストが、残った簡体字または繁体字の隠れる場所です。
時間を節約する修復の順
- 出発点が読める中国語であり、文字化けやスキャンではないことを確認する。
- 正しい地域タイプを選んだことを確認する。
- 見本を変換し、それからファイル全体を変換する。
- 統合字と保護する固有名を検索する。
- レイアウトとフォントを確認する。
- それからだけファイルを送る。
変換し、問題に気づき、すでに変換したファイルから再び変換すると、診断が難しくなります。元に戻ってください。
よくある質問
出力が流暢に見えます。校正を省略できますか? 流暢さはまさに、名の中の誤った後の見え方です。最低でも固有名とタイトルを眺めてください。
PDFの一部だけが変わったのはなぜですか? 残りはおそらく輪郭、画像、またはテキストとして取り出されなかったフォントサブセットです。
悪い変換を取り消せますか? 元のファイルを残したときだけです。戻して変換することに頼らないでください。
長い文書はより頻繁に失敗しますか? 文あたりの率ではなく、より多くの場所で失敗します。見本ページはなおほとんどの辞書の問題を予測します。すべての固有名は予測しません。