Дослідження можливостей програми Fine Reader
Автоматизація вводу інформації в комп'ютер
Основним методом переводу паперових документів в електрону форму являється сканування. Сканування - це технологічний процес, в результаті якого створюється графічний образ паперового документа. Існує декілька видів сканерів, але в їх основу покладено один і той же принцип. Документи освітлюються світлом від спеціального джерела, а відображене світло сприймається світло відображаючим елементом. Мінімальний елемент зображення передається сканером, як кольорова точка. Таким чином в результаті сканування документа створюється графічний файл в, якому зберігається растрове зображення первинного документа. Растрове зображення складається, як відомо з точок. Кількість точок визначається, як розміром зображення так і розширенням сканера.
Автоматичне розпізнання текстуПісля обробки документа сканером виходить графічне зображення документа. Але графічний вигляд не являється текстом документа. Людині досить подивитись на листок паперу з текстом, щоб зрозуміти, що на ньому написано. З точки зору комп'ютера, документ після сканування перетворюється в набір різнокольорових точок, а не в текстовий документ. Проблема розпізнання тексту в складі точкового графічного зображення являється дуже складною. Подібні задачі вирішуються за допомогою спеціальних програмних засобів, називаються вони засоби розпізнання зображень. Реальний технічний прорив в цій області пройшов лише в останні роки. До того розпізнання тексту було можливо лише шляхом порівняння знайдених конфігурацій точок із стандартним зразком. Автори програми критерій “схожості” використовуваний при ідентифікації символів. Такі системи називаються ОСR(OptikalCharacted Recognition-оптичне розпізнання символів) і оперались на спеціально вироблені шрифти. З часом наукові дослідження в області розпізнання зображень буквально перевернули представлення при оптичному розпізнані символів. Сучасні програми можуть ставитись з різноманітними шрифтами без перенастройки. Багато розпізнають навіть малюнковий.
Програми розпізнання текстів
Оскільки потреба в розпізнані тексту відсканованих документів достатньо велика, невипадково, що є велика кількість програм, призначена для такої цілі. Так, як різні наукові методи розпізнання тексту розвивалась незалежно один від одного, багато із цих програм використовують різні алгоритми. Ці алгоритми можуть давати різні результати на різні документи. Наприклад, система OCR здібна розпізнати тільки стандартний спеціально підготовлений шрифт і дають на цьому шрифті найкращі результати, які не можуть перевершити ні одна із універсальних програм. Сучасні алгоритми розпізнання тексту не орієнтуються на конкретний шрифт, ні на конкретний алфавіт. Більшість програм розпізнають текст на декількох мовах. Один і той же алгоритм можна використовувати для розпізнання російського, латинського, арабського і других алфавітів і навіть змішаних текстів. Розуміється програма повинна знати про який алфавіт іде мова. Нас перш за все інтересують програми здатні розпізнавати текст, написаний на російській мові. Такі програми випускаються вітчизняними виробниками. Найбільш широко відомі і розповсюджені програми Fine Reader і Cunei Form. Програма Fine Reader забезпечує високу якість розпізнання і вигоду застосування.
Розпізнання документів в програмі Fine Reader
Програма Fine Reader виготовляється вітчизняною компанією АВВУУ Software(w.w.w. bitsoft.ru.). Ця програма призначена для розпізнання текстів на російському, англійському, німецькому, українському, французькому і багатьох інших мовах, а також для розпізнання змішаних двох мовних текстів. Програма має ряд можливостей. Вона дозволяє об'єднати сканування і розпізнання в одну операцію, працювати з пакетами документів і бланками. Програму можна навчити для кращої якості розпізнання неправильно надрукованих текстів і складних шрифтів. Вона дозволяє редагувати текст і провіряти його орфографію. Fine Reader працює з різними моделями сканерів. Програма дотримується стандарту TWAIN. Ми розглянемо програму на прикладі версії 4.0 одну із основних версій.
Вікно програми
Після включення програми Fine Reader в меню програми головного меню появляються пункти, забезпечуючи роботу з нею. Вікно програми має типовий для Windows 9х вид і має стрічку меню, ряд панелей інструментів і робочу область.
В лівій частині робочої області розміщується панель Пакет, містить список графічних документів які повинні бути перетворені в текст. Ці графічні файли розглядаються, як частинки одного документа. Результати її обробки в подальшому об'єднуються в єдиний текстовий файл. Форма значка, відмічає початковий файл і вказує чи було проведено розпізнання.