XMATヘルプページ|LDX lab

言語資産管理(抽出データ一覧)

作成者: Admin|Jul 8, 2026, 5:56:00 AM

言語資産とは

本システムにおける言語資産には「TM(翻訳メモリー)」、「用語集」「参照ファイル」の3種類があります。「TM(翻訳メモリー)」と「用語集」は原則としては原文と訳文のペア(TU=Translation Unit)を1行としてカウントします。言語資産は以下の3つの方法で登録することができます。詳細は後述のセクションをご確認ください。登録した言語資産は、本システムのQuick PEおよびカスタマイズ(LAC)で利用できます。
(1) お客様のお手元にある言語データをインポートする。
(2) インターネット上のテキスト(またはお客様のファイル)からAIを活用して言語データを抽出し、アラインしたデータをインポートする。
(3) 本システムで提供されているストックデータをインポートする。

 

サービス 利用方法 TM
(ストックデータ以外)
TM
(ストックデータ)
用語集 参照ファイル
Quick PE 用語集として選択 - -  
翻訳メモリーとして選択 -  
参照ファイルとして使用
QuickMT 参照ファイルとして使用
カスタマイズ(LAC)
(カスタムMTモデル管理)
追加学習の教師データに利用して追加学習モデルを作成  
汎用/カスタムMTモデルに設定して用語集設定モデルを作成 - -  

抽出データ一覧画面の見方

本画面には、組織内で登録されている抽出データの一覧が表示されます。本システムにおける抽出データとは、インターネット上のテキスト(またはお客様のファイル)からAIを活用して言語データを抽出したものです。本画面では、条件を指定して抽出データを検索することもできます。新たにデータを抽出するには、画面上部の [+ 新規登録] をクリックしてください。 

  • 検索条件エリア
    • 抽出対象:「Webサイト」または「ファイル」を選択できます。
    • 名称
    • 登録開始日(UTC)
    • URL/ファイル名
    • [アライン] ボタン:一覧にある抽出データを2件以上選択するとボタンを押せる状態になります。アライン処理の詳細については後述のセクションをご確認ください。
  • 抽出データ一覧
    • 名称:抽出時に付与した抽出データの名称。クリックすると抽出データ詳細画面が表示されます。
    • URL/ファイル名:抽出対象としたURL(抽出対象が「Webサイト」の場合)またはファイル名(抽出対象が「ファイル」の場合)
    • 再帰実行:抽出時に [再帰実行する] を有効にした場合は「○」が表示されます。
    • 言語:抽出時に指定した言語
    • ステータス:以下のいずれかが表示されます。「抽出処理完了」の抽出データのみ、アライン処理の対象として選択することができます。
      • 未処理:まだ抽出処理が開始されていません。
      • 抽出処理中:抽出処理中です。
      • 抽出処理完了:抽出処理が完了して、アライン処理を実行できる状態です。
      • 抽出処理エラー:抽出処理が開始されたものの、何らかの理由により途中で失敗した状態です。
      • 削除エラー:削除処理が開始されたものの、何らかの理由により途中で失敗した状態です。
    • データ量
    • アライン:「原語」、「訳語」を指定した抽出データを2件以上選択して [アライン] ボタンを押すと、アライン処理が実行されます。
    • [表示] ボタン:抽出データに含まれるテキストの全行を確認できます。編集や削除はできません。

 

アライン処理とは

抽出データを言語資産として登録するには、原語と訳語に指定したデータ(原文と訳文)に対してアライン処理(アラインメント)を実行してTMを作成します。[アライン] ボタンを押すとダイアログが表示されて判定基準を設定できます。後述のセクション [LeftoverTMと判定基準] を参考に選択して [アライン実行] ボタンを押してください。

LeftoverTMと判定基準

言語資産としてTMを登録する際、元となる抽出データから言語資産として採用する基準を指定します。本システムでは、このように基準を満たさないデータはノイズ(誤訳や対応ずれ)であり、そのままの状態ではTMに適さないデータであるという考えから、TMには採用せず「Leftover」として取り扱います。ノイズのみを集めたTMが「LeftoverTM」です。

元となる抽出データによっては、判定基準を満たすデータのみを集めたTMとは別に、判定基準を満たさないデータのみを集めたLeftoverTMが登録されます(登録される言語資産名の末尾に「(LeftoverTM)」が自動的に付与されます)。以下を参考にして判定基準を指定してください。

  • きつめ (ノイズが減る):きつい基準で判定するため、採用されるデータ(TU数)は少なくなりますが、ノイズも減ります。ノイズが多く含まれている抽出データから、できるだけ品質の高いTMを作成したい場合に指定してください。
  • おすすめ:初期値です。「きつめ」「ゆるめ」のどちらにも該当しない場合に指定してください。
  • ゆるめ (ノイズが増える):ゆるい基準で判定するため、採用されるデータ(TU数)は多くなりますが、その分、ノイズも増えます。元となる抽出データをできるだけTMに採用したい場合に指定してください。