TikaOnDotNetとxdoc2txtとの比較
つい先日知ったTikaOnDotNetと、xdoc2txtとの対比を行ってみました。視点が偏っているかもしれませんので参考までにご覧ください。比較表
| 長所 | 短所 | |
|---|---|---|
| TikaOnDotNet | ・組み込みが簡単 C#でたった数行でテキスト解析できる ・イメージファイルを含むファイルのメタ情報も取得可能 | ・JUST SYSTEMの一太郎は抽出できない |
| xdoc2txt | ・対応文書が多い(一太郎も含む。iFilterも利用できる) | ・コーディングが少し複雑 |
一太郎文書
仮に一太郎文書をTikaOnDotNetで解析させてみたらどうなるか試してみました。一太郎文書としては、スタイルを使った「大見出し」「中見出し」と、表とを入れた文書を作成しました。
解析結果は、デバッグ途中の変数の中身を見てみます。文書の中身であるTextは、すべて空文字でした。つまり取得できませんでした。ファイルに保存されているメタデータは、たくさん取得していることがわかります。
PNGファイル
ちなみにPNGファイルもテキスト抽出してみました。OCRとかがかかるわけでもないので、ファイルのメタ情報のみが取得されます。図形の大きさ(たてxよこ)等が取得されていることがわかりました。
まだコメントはありません。最初のコメントを投稿してみませんか?