ラベル 自炊 の投稿を表示しています。 すべての投稿を表示
ラベル 自炊 の投稿を表示しています。 すべての投稿を表示

2014年1月12日日曜日

PDFのハイライト注釈部分のテキスト内容を取得する



 電子書籍が普及しつつあり個人的にも読書のメインはそちらに移行しているが、まだまだ対応していない書籍も多く、やむを得ず自炊(裁断・スキャンしてPDF化)したりもする。また、WEB上で公開される文書や各種レポートなど実務で使用する資料はPDF形式が多く、PDFファイルを読む機会はまだまだ多い。

 自炊本やレポートなど長めのPDFを読む際は重要な箇所や印象的な箇所に「ハイライト(ラインマーカー)注釈」をつけながら読んだりする。この機能自体はたいていのPDFリーダーにはあるはず。
 紙の時代にも蛍光ペンを引いたりしたと思うが、デジタルデータであればハイライト箇所に瞬時にたどり着くことが出来るし、間違えたらすぐ消せるし、色も変えたい放題だし、さすがに紙の時よりは便利になっている。

 で、ハイライト箇所の内容(テキスト)を一覧したり、その箇所をまとめてテキストファイルに保存するのも当たり前のように簡単に出来るんだろうと思いきや、意外にそうでもなかったのでまとめておく。(何か大いなる勘違いをしてるんだろうか・・・。)
 


◆ ハイライト箇所の内容の一覧


 PDFを読むツールとしてはAdobeReaderという無償ソフトが代表的なものだろう。Windowsはもちろん、Macや、iOS・Android用のモバイル版も用意されている。
 試しにWin版のAdobeReaderでハイライト注釈をつけてみる。
 
 
 上記の通り、ハイライト箇所が右側の注釈のリスト画面にまとめられ、ハイライト箇所のページ数や日時などが記録される。これらをクリックすれば瞬時にその箇所に移動できる。が、なぜこの画面でそのハイライトを付けたテキストの内容まで表示してくれないのだろうか。
 ハイライト箇所を瞬時に移動できると言ってもページ数と注釈日時だけじゃどこに何が書いてあったのかすぐに分からない。目的の箇所に辿り着くまで1個目のハイライト箇所からクリックしてみるというのもバカバカしい。

 なお、他にもPDF-XChangeViewerやFoxitReaderなど、PDFリーダーは山ほどあり、かなりの数を試したがこれらWin版のソフトはどれもダメだった。(ひとつだけ例外あり)
 

 では、Macではどうだろう。MacのPreview.appならオシャレにこの問題を解決してくれるんじゃないか、そう思い試してみた。
 
 
 最初の3つの注釈はWinのAdobeReaderでつけたもの。やはりテキストは表示されていない。が、次の2つの注釈はPreview.appでつけたもの。ハイライト箇所のテキスト全部ではなく最初の部分だけだが、趣旨的にはギリギリOKと言えなくもない。さすがMacや。と言いたいところだが、やはり縦書の日本語OCRをかけたPDFという条件が悪いのか、ラインマーカーの表示が崩れるというか何というか・・・。
 ちなみに一つ目は「すべてはひとつに通ずる。すべての人に視力を」、二つ目は「アラヴィンドは、専門的で高品質のサービスを無料で~(中略)~産まれる威力を証明するモデルなのだ。」まで引いたのだがこの有り様。雑過ぎるやろ。ウチの3歳の息子でももっと上手に線引けるわ。
 
 
 Win(AdobeReaderほか)がダメ、Mac(Preview.app)がダメ、ときて次はモバイルOSの方だが。結論から言うとこちらはあっさり解決した。まず、Androidの「Moon+ Reader Pro」というアプリ。無償版もあるが、PDFの閲覧機能は有償版のみのようだ。
 こちらのアプリではハイライトをつけるとその箇所が一覧できる。ま、OCRの精度はちょっと置いておくとして・・・。
 
 
 
 もうひとつ、「ezPDF Reader」(Pro版)というアプリでも可能だ。Free(Trial)版やLite版がどうなのかは不明だが多分OKな気はする。が、Androidの「ezPDF Reader」アプリだと、横書きのものは日本語OCRの自炊書籍でもOKだが、縦書になるとダメみたい・・・残念。
 
 iPhoneのアプリでは、まず有名ドコロの「GoodReader」、基本的にハイライト機能はあるものの、それを一覧する画面がそもそも見当たらず。また、通常のPDFなら普通にマーカーを引けるが縦書日本語OCRだとマーカーを引くこともできなかった。昔はさんざんお世話になったアプリだが・・・。
 
 次は「PDF Expert」というiOSアプリ。以前にもちらっと紹介したことがあるが、さすがに優秀でハイライト箇所がその内容とともに一覧できる。が、こちらも縦書日本語OCRが苦手のようでそもそもテキストをしっかり選択できない。横書日本語OCRなら問題ない。ただ基本的にちょっと重い。

 iOS版の「ezPDF Reader」は基本的にOKだが・・・詳細後述。
 

 このように、ハイライト箇所のテキスト取得に関してはモバイル用のアプリの方が優秀なのだが、やはりPCでPDFファイルを見る機会も多いので何とかしたいところ。
 で、先ほど「ひとつだけ例外あり」と書いたが、どうやらAcrobat(Std&Pro)はそういう機能があるらしい。普段AcrobatProを使ってるけどこんあ機能があるなんて全然知らなかったヨ・・・。
 
 
 上の画像の通り、環境設定画面で「選択したテキストをハイライト、取り消し線、下線の注釈ポップアップにコピー(X)」という箇所にチェックを入れるとOKのようだ。実にあっけなかった・・・。
 

 
 これで求めていた機能のひとつはPCでもモバイルでも満たされた。できればAcrobat(Std&Pro)だけでなくフリーのPDFのリーダーで実現したかったが。

====

◆ ハイライト箇所の内容のテキストファイル取得


 次に、そのハイライト箇所のテキスト内容をプレーンなテキストファイルに保存出来るかどうかという点。ハイライトを付ける箇所は重要であり後で見返す可能性が高い部分なので、汎用性の高いテキストファイルという形式でも念のため保存しておきたい。OCRかけたものだと誤認識も多いのでその編集もしたいし。ハイライトをつける度に別途コピペして~というのはナシとして。
 
 例えば、AdobeReaderではハイライト箇所をまとめてfdf形式あるいはxfdf形式で書き出すことが出来る。が、これらのファイルはテキストエディタで開いても文字化けして使いものにならない。(データ量的に、やはりハイライト箇所のテキスト自体は取得できているのだろうか。一覧に表示されないだけで。)
 Acrobat(Std&Pro)だとそれ以外に「Wordに書き出し」という機能があり、これなら楽勝かと思いきや、「PDFがタグ付けされてません」とかいう意味不明なエラーが出てしまう。
 

 
 「注釈の一覧を印刷」や「注釈の一覧を作成」というメニューもあるが、これもちょっと求めてる機能と違う感じ。
 ということでAdobeのツールだけだと無理っぽい。
 ちなみに、MacのPreview.appもハイライト箇所のテキストは表示されるもののそれを一覧にしてテキストファイルとして吐き出す機能はなさそう。
 

 ではモバイルアプリはどうかというと・・・
 「Moon+ Reader Pro」(Android)、「ezPDF Reader」(Android&iOS)、この2つは普通にテキストファイルとしてエクスポート出来る。素晴らしい!!
 最初からこれらのアプリを利用してハイライトを付けたPDFだけでなく、例えばPC上のAcrobat(Std&Pro)でハイライトをつけたPDFでもOK。DropboxやGoogleDriveなどでファイルをモバイル環境へ共有し、これらのアプリで開けばハイライト箇所のテキストファイルを簡単に作成することができる。ということで、こちらの問題も解決。
 ※ iOS版「ezPDF Reader」は、バグなのか現在はDropbox連携はエラーが出て使えず。
 
====

◆ 既ハイライト箇所(非表示)のテキスト取得


 例えば、今までAdobeReaderでハイライトをつけたPDFファルがあるとして、それをAcrobat(Std&Pro)や「Moon+ Reader Pro」などで開いてもハイライト箇所のテキストは残念ながら表示されない。「見えてないだけでテキスト自体は取れてるんでしょ?」とばかりに念のためテキストファイルとしてエクスポートしてみるが、やはりその部分のテキストは保存されない。

 じゃあ今までつけたハイライト箇所のテキストを取ることは出来ないのかというと・・・・iOS版の「ezPDF Reader」なら出来なくもない。Android版だとダメ。
 どういうわけか、iOS版の「ezPDF Reader」のみ、他のPDFリーダーでつけたテキスト非表示のハイライト箇所も表示されるし、もちろんテキストファイルのエクスポートも可能。
 

 
 ただ、iOS版の「ezPDF Reader」自体はAndroid版に比べると完成度も低い感じでバグも多く不安定。必ずしも100%取れるわけではないし、なぜかハイライト箇所のテキストがダブって表示・保存されることもあるので要注意だが。どうしても過去につけたハイライト箇所のテキストを取りたい場合には試す価値はあるかと。
 


 なお、今回サンプルとして使用させて頂いたのは、もはや私にとってバイブルと言っても良い「ビジョナリーであるということ」という書籍。勝手にあちこち引用しちゃって恐縮だが。紙の書籍とKindle版、両方買ったのでなんとか勘弁して欲しい。





2012年11月11日日曜日

ScanSnap S1100で両面同時スキャンする方法



もはや上の画像が全てを物語っているが・・・。

私が愛してやまないスキャナー、ScanSnap S1100。
こちらの記事でもその魅力を語っているところであるが。

そんなS1100も、さすがに両面同時スキャンの機能はない。
が、それを実現する方法を思いついた。



そうだ、2台使えばいいんじゃね?!



1台は普通に設置する。
もう1台は裏返して設置する。
この2台のスキャナーを連続して通すことで両面同時スキャンを実現しよう、と。


やってみたら、思った以上にうまくいった。


最初の1枚目こそ2台ともスタートボタンを押す必要があるが。
自動読込装置があるので2枚目以降は紙をテンポよく挿すだけでOK。
2台目で読み込む時に少しだけ流れが止まるが、まぁスキャンに支障はない。

裏返した方は蓋がパカパカするのでテープで留めたりなんかして。
設置する2台のスキャナーの「間隔」が微妙にポイントだったりする。


ただ、ひとつだけ、たったひとつだけ問題が。(← ひとつだけか?)



どうやら1台のPCに2台のScanSnapは接続できないようだ。

つまり、ScanSnapも2台、PCも2台必要ということ。
もしかしたら、仮想OSでUSBの接続を別々に設定出来れば1台のPCでも可能かも。
残念ながらそこまでは検証していないが。

まぁ、もっとも、そもそもスキャナーを2台用意してまで両面を同時にスキャンするメリットがあるのかと聞かれれば。


・・・・・ない。



そう、もちろんそんなメリットはない。

が、万が一やってみたとして。
スキャナーの設定でファイル形式をPDFとした場合、当然ながら奇数ページのPDFと偶数ページのPDFが出来る。

これは後で「PDF Split and Merge」などのソフトを使ってひとつのファイルにすれば良いだろう。


ま、そもそもやらないと思うけど。


P.S
S1100のホワイトモデル、欲しいなぁ~・・・。




2012年7月27日金曜日

中華タブレット+USBミニ扇風機


本当のところはどうなのか知らないが。
電力不足だ、計画停電だ、って話がある以上、出来る範囲で節電してみようかと。
てな訳でこの夏は基本的に事務所のエアコンはつけず、扇風機でしのぐ予定。
あくまでも予定だが。


ということで、少し前に卓上のUSB扇風機を購入して使っている。



・・・・これが意外といい感じ。

音も思ったよりも静か。
もちろん扇風機だけだとツライので、アイスノンや半裸(上半身裸)を併用してではあるが、「この夏、乗りきれるんじゃね?」と思い始めている。

ただ、買ったあとに気付いたのだが、首振り機能はない。
こっちにしておけばよかったような気もしている。





で、ここからが本題だが。

書籍をPDF化して中華タブレットで読む、というのが今の私の読書スタイル。
その場所は主にトイレの中が多い。
で、そのトイレの中が死ぬほど暑い。
堪りかねてある日卓上の扇風機をトイレに持ち込んでみた。
USB式なので中華タブレットに挿して使うことが出来る。

・・・・これがまたいい感じ。

ただ、いくら卓上タイプでさほど大きくないとはいえ、毎度持ち運ぶのはやや不便というかメンドクサイ。
クリップ式で挟めるのだがトイレ内に適当な箇所がなく、といってタブレット端末につけると重すぎるし邪魔。
また、屋内ならまだしも、さすがに外に持ち歩くのはちょっと無理。


ならばもっと小さいやつを、ということでこちらを買ってみた。



・・・・エエやん。

さすがに「あ~、超涼しい~」とまではいかないが。
羽はやわらか素材でできてるので稼働中に触っても問題なし。
風量は卓上タイプに比べればあれだが、まぁなんとか。
音は、多少「ブィィィ~ン」という音がするがこれも我慢できる範囲。
ちなみに、Amazonレビューで「プロペラを外してモーターの軸にクレ556的な潤滑油を注すとほとんど音がしなくなる」と書いてあったので試そうと思ったが、羽の外し方が分からず・・・。
とりあえず軸の見えてる部分にクレ556を注してみたが、全く効果はなかった。

サイズ的にはちょうどいい感じだし、外に持ち歩くのも一応アリかな、と。
収納ケースもついてることだし。


そんな訳で、ビバ!モバイル扇風機!!


P.S
そういえば子どもが乾電池で動く手のひらサイズの扇風機持ってたのを思い出した。
わざわざ買わなくてもそれで良かったんじゃ・・・・・。
という気がしないでもないが、忘れることにする。

P.S
そういえば、トイレの次に多いのが移動中の電車内での読書。
でも、電車の中って涼しいし、場合によってはむしろ寒いくらい。
わざわざ扇風機を持ち歩く必要があるんだろうか・・・・・。
という気がしないでもないが、忘れることにする。


2012年6月4日月曜日

中華タブレット買ったった 3

またまた続き(前回「Blog the Minor: 中華タブレット買ったった 2」)

購入したのはこちら。(メーカー:Zenithink モデル:ZT ICS)







前回は不満な点を挙げたのだが、思ったほど挙がらず。
なので今度は満足している点を挙げまくってやろうと思いきや、これもあまり思い浮かばず・・・・。

結局、中華タブレットのメリットって「値段」に尽きる。
iPadやハイエンドな有名メーカーのAndroidタブレットに比べれば2分の1とか3分の1程度の値段で買える。
が、もちろん同程度の性能のものがそんなに安いわけはなく、安いなりにスペックは落ちるわけだが。
私のような「3万も4万も出せないけど、でもタブレット端末とやらを試してみたい」という人には大変有難い存在である。

で、実際試してみて・・・・・いや、タブレットをナメてた。
こんなに使いやすいものだったとは。

何がいいって、まぁ本が読みやすい。
中華タブレットの、というよりはタブレット端末の特性としてスマホに比べて画面が大きいんだから、当たり前といえば当たり前。
でも、なんというか、予想を超えて読みやすい。

PDF化してスマートフォンで読むのというのが今までの私の読書スタイル。
電車の中や外出先で手の空いた時、そしてトイレの中など。
ちなみに、スマートフォンでの読書は今でも全然アリだと思っている。
ただ、文庫本の小説とかだと充分なのだが、横書きの本や図解などが入った本になると厳しい。

で、そういった本もこのタブレット端末で読むと実に快適。
実務で使う専門書なども読みやすい。

今回購入した端末は10インチなので、トイレはともかく、さすがに外に持って行くとかはあまり考えてなかったが。
それが、すっかり持ち歩くようになっちゃうくらい読書が快適。
もっと荷物が重たくなると思ったが、そうでもなかったし。
この端末の重量が約600gということで、ヤングジャンプ1冊分だそうだ。
(このサイト調べ → ITmedia Biz.ID:モノの重さをわかりやすく例える)

ヤンジャン1冊分と思えば確かに持ち歩くのは苦にならないし。
大きさ的にも、電車内で出しても別に気にならないし。
何時間もずっと持ってるわけじゃないから腕の疲れもそれほどでもないし。

読書が楽しくなる、というこの一点だけでもこの買い物はモトをとった気分。

ちなみに、いま読んでる本はこちら。
ちょっとリスティング広告を勉強してみようかと思ってて・・・。







スバラシイ本です、コレ。
テクニックだけでなく「本質」も盛り込んだ、
マジおすすめの有意義な一冊!

「・・・・・・」


え、え〜と、iPhone4Sとの比較画像。


別の本でNexusOneとの比較画像。

本タブレットの画像がやや暗く見えるが、肉眼だとそれほど気にはならない。
そらまぁiPhoneとかと比べちゃったらアレだけども・・・。
ちなみに写真撮影時はディスプレイの明るさを最高にしたが、普段は7~8割の明るさでも充分。

あ、ちなみに、Android機での読書はもっぱらこのアプリ。

ezPDF Reader
Unidocs Inc.
価格:undefined  平均評価:4.6(9,208)


PDFリーダーのアプリは結構いろいろ試したけど。
いまのところコレが一番お気に入り。


というわけで、なんかとっても月並みな内容になっちゃったけど・・・。
読書以外で使うアプリなんかの紹介はまたおいおい。
用途が読書中心なら7インチの端末なんかも確かにいいかも。
7インチの中華タブレットなら品揃えも豊富だし。
1万円前後くらいから買えるし。

次はどれを試してみようかな・・・・。



2012年3月22日木曜日

しおり(目次)のないPDFなんて読めるかっ!(後編)

前回(Blog the Minor: しおり(目次)のないPDFなんて読めるかっ!(前編) )の続きで、JPdfBookmarksで取り込むための目次内容を記載したテキストファイルの作り方。


1.目次のページをスキャン・OCR


目次のページだけをやや高画質でスキャンしてOCRソフトにかける。
レポート等で文字情報が含まれているPDFならコピペでもOK。
OCRをかける時は目次内容とページ数は別セルとなるように表形式で。
列ごとの文字種別は特に指定しなくても割と正確に認識するが、テンプレで指定できればした方が良いかも。
多少の誤認識は無視する。(あとでExcel上で修正したり、PDFを閲覧中に気付いたら直す程度で良いかと)

ちなみに、このような目次ページならラクなんだけど、

書籍によってはこういう目次も・・・。

ページ数が右揃えじゃないとデータを取るのにひと手間かかる。
けど、まぁ、なんとかなる。



2.Excel上でデータを目次加工


OCRの認識結果をExcelに貼りつけ


先ほどのページ数が右揃えじゃない場合はこんな感じ。


まずは一番上の行にタイトル(#・内容・頁)、一番左の列に通し番号をふってオートフィルタ設定


ページ数が右揃えじゃない場合はExcelの関数を利用してページ数を抽出する。


今度は目次内容のセルに含まれるページ数を除去する。(D列の内容を後でB列に「値のみ貼付け」)


「内容」でソートをかけ、一括置換等で少し手直し。
大体直し終わったら「・・・」や「/」「PDF上の頁数」「その他情報」「全部連結」を1行目に追加して全行にコピーする。


全部連結した内容(上記のH列)をコピーして、別シートのB2へ「値のみ貼付け」、タイトルと通しNo.も設定


目次内容のレベル(階層)ごとに列を分ける
例)章・節・1・(1)・① など



3.テキストファイルとして保存する


タイトル行と通し番号列以外の全内容をコピー


新規テキストファイルに貼付けて保存する。
テキストファイルの文字コードはSJISで。
Winのメモ帳なら文字コードはあまり意識しなくて良いかも。


以上、こんな感じでやるのだが。
もうちょっとスマートに出来そうな気もしないでもないが現状はこれが精一杯。


やはりOCRをかけて誤認識の部分を修正するというのがどうしても面倒だ。
最初から目次のデータがあればいいのに、と思ってしまう。
Amazonなどでも書籍紹介で目次は掲載されているが、大まかな目次だけで残念ながら詳細目次の記載はない。

で、例えば、税務関係の書籍が充実している我らが大蔵財務協会。
書籍紹介ページに「詳細目次」の文字がっ!


やるじゃねーかっ!と思いつつ「詳細目次」をクリックしてみると、

おぉっ!!!おぉ・・・お?・・・・・・・・


ページ数が載ってねーじゃねーか・・・・・。

まぁ版を重ねると微妙にページ数が変わったりすることもあったりするの?
よく分かんないけど。
なので仕方ないといえば仕方ないのかも知れないが・・・残念すぎる。


そんなこんなで、シコシコとOCRをかける作業が続くわけで。

で、こんなツマラナイ作業は誰か一人がやって、その目次データを共有できたらいいなと思うわけで。

そんなサービスを作ってみたいと思う今日この頃である。

オシマイ。





2012年3月20日火曜日

しおり(目次)のないPDFなんて読めるかっ!(前編)

ペーパーレス化を目指し、多くのドキュメントをPDF化してる。
いわゆる自炊ってやつもやってる。
書籍を裁断・スキャンしてPDFファイルにする行為だ。
ちなみに、誰が言い出したか知らないが、この「自炊」って呼び方はキライ。
他に呼び方がないのでつい使っちゃうけど。

そんな訳でPDFファイルを扱うことが多いのだが。
ちょっと量(ページ数)が多いものは「しおり※」がないと読む気にならない。
※ ブックマークとか見出しとかいう場合もあるかも。

書籍をスキャンしたPDFには「目次」のページももちろんあるが、


それだけじゃダメで、PDF上のしおりがないと意味がない。


で、量が多いPDFといえばやはり書籍だ。
普段読む本は経済小説やビジネス書が多いが、これらは別にしおりとか不要。
基本的に頭から順に読むし、読み終わったら再度読み返すことがあまりないから。

問題は仕事で使う税務関係の専門書や、各種レポート等のPDFファイルなど。
これらは頭から読むものというよりは必要な時に必要な箇所をさっと参照するような使い方になる。

基本的に書籍をスキャンしてPDF化するときはOCRはかけない。
認識率を高くしようとすると手間がかかるし、とりあえずのOCRだけだとあまり使いものにならないので時間やマシンパワーの無駄遣いと感じるから。
「しおり」があれば、とにかく「しおり」さえあれば、目的のページには割とすぐに辿りつける。
なのでそれで充分かなと思うし、逆にこれがないと本当に読む気にならない。
スマートフォンでそういうPDFを見る場合でもしおりがなければ該当ページに辿りつくのは相当難しいが、しおりがあればなんとかなると思う。
まぁスマートフォンで見ることは滅多にないけど。


ということで、PDFのしおりを加工するソフトを探していて、ある時、某社の◯ウトライナーというソフトを購入してみた。
体験版もないしちょっと高い感じはしたが、代替も見つけられず仕方なく。
これがまた使えないというか、非常に残念なものだった。
ソフトそのものに問題があるというよりは、自分の期待が高すぎたのだろうが。
とにかくほとんど役に立たなかった。


で、あとで知ったのがJPdfBookmarksというソフト。

なんと!なんとですよ、奥さん!
オープンソースで無料で使える!

しかも!しかもですよ、奥さん!
WinだけじゃなくてMacでもLinuxでも使える!(CLIでも!)

さらに!さらにですよ、奥さん!
ア◯トライナーと比べてもはるかに簡単に使える!

どうですか!どうですか、奥さん!!


しおり(目次)の内容を予めテキストファイルに保存しておけば、これをJPdfBookmarksで一気に取り込める。
手順はこれだけ。
  1. jpdfbookmarksを起動
  2. 対象となる書籍PDFファイル(目次・内容を含む全ページのもの)を開く
  3. 「Tool」→「Load」からそのテキストファイルを選択して開く
  4. しおりが取り込まれるのでざっと確認して問題なければ上書き保存

たったこれだけでしおりを含んだPDFファイルが完成する。

では、そのテキストファイルはどのように準備するのか。
テキストファイルを読み込んでしおりにするだけならアウ◯ライナー含め他のソフトでも出来るものはあると思う。
が、JPdfBookmarksの方がそのテキストファイルに記載する形式が簡単で済むという感じか。
とはいえ、データを作るまでは多少面倒だし、説明も長くなるので後編で。


なお、専門書などは分厚いものが多く、目次(しおり)だけでも結構な量となる。
その中から目的のページを探すのも結構大変な時があるが、そんな時こそ検索。
ただ、本文はOCRをかけていないので、通常の検索をしても全くヒットしない。
で、PDFリーダーによっては検索機能に「しおりを含めて検索」というオプションがある。
純正のAcrobatReader(Acrobat)はそのオプションがあるし、私が常用しているPDF-XChange Viewerも大丈夫。
Nitro PDF Readerはなかったかな。(最新版は未確認)
そして残念なことに、MacのPreviewにはそのようなオプションがない・・・・。
Mac用のAcrobatReaderならもちろんOK。


そんな訳で、今日はこのへんで。