Синтаксичний аналіз у системах автоматичного перекладу: концепції та алгоритми
В першій частині обробляються вузли двух видів: 1) особові форми дієслова, предикати, предикативні формули, тобто вузли, які можуть виконувати функцію присудка; 2) підрядні сполучники. Виясняється, які з головних вершин є вершинами підрядних речень, а які - ні. Одночасно в СінП формуються штучні вузли, що символізують підрядні речення, та зв’язок ref, а також формується та частина позиційної таблиці, в якій перелічені головні вершини по порядку їх слідування у фразі і для кожної з них вказано, чи є вона, за відомостями, отриманими в цій частині блоку, вершиною незалежного або підрядного речення.
В другій частині перевіряється правильність складу головних вершин СінП за позиційною таблицею. Представлення, що є правильними, пропускаються в наступний блок аналізу. До них відносяться ті представлення, в яких є не більше однієї незалежної головної вершини, а всі інші – вершини підрядних речень. В цій частині блоку затримуються і підлягають аналізу ті представлення, в яких більше однієї незалежної вершини або є вершини з недозволеною омонімією. Для таких вершин алгоритм звертається до СінП і аналізує лівий контекст. В результаті аналізу контексту можливі такі дії: 1) розділення складного речення на прості при наявності відокремлювача; 2) встановлення сурядного зв’язку між головним реченням фрази і одним з незалежних простих речень при наявності сурядного сполучника; 3) видалення номеру незалежної вершини з позиційної таблиці, що рівнозначно визнанню цієї вершини присурядненою частиною присудка одного з попередніх речень; 4) дозвіл омонімії сполучника або головної вершини. Після виконання однієї з цих дій представлення знову перевіряється на правильність складу головних вершин.
Блок аналізу простих речень
В цьому блоці продовжується оброблення того набору зв’язків, який був встановлений аналізатором перед роботою попереднього блоку і уточнений цим останнім.
Аналіз проводиться за допомогою позиційної таблиці, в якій поступово заповнюються номерами вузлів спеціально відведені для них місця. Для кожного символу простого речення в ній відведено п’ять позицій: 1) між початком речення і найвіддаленішим від присудка лівим актантом; 2) між найближчим до присудка лівим актантом і присудком; 3) між присудком і найближчим до нього правим актантом; 4) між двума актантами; 5) між найвіддаленішим від присудка правим актантом і кінцем речення.
Процес аналізу визначається почергово двума алгоритмами: перший, загальний, керує аналізом всієї фрази; другий – аналізом підрядних речень.Вхідним пунктом для аналізу є присудок головного речення. Спочатку визначається перша позиція від початку речення до присудка (вважається, що жодного актанта слова ще не знайдено). Потім починається обробка цієї позиції. Якщо в ній є підрядні речення, то в дію вступає другий керуючий алгоритм і аналізується кожне з них в певному порядку. Номера проаналізованих вузлів викреслюються з позиційної таблиці. Коли аналіз підрядних речень закінчений, аналізуються прислівникові, дієприслівникові та інфінітивні синтаксичні обороти. Після цього позиція оброблюється підблоком аналізу твору, який складається з аналізатору, що встановлює лише сурядні зв’язки, та алгоритма обробки результатів роботи цього аналізатора. Тільки після цього серед залишених в позиції вузлів відшукуються актанти присудка і відбувається перерозподіл номерів вузлів в позиційній таблиці між першою та другою позиціями. Аналогічно оброблюється фраза праворуч від присудка.
В цьому блоці встановлюються такі функції вузлів: підмет, пряме доповнення, непряме доповнення. Встановлення інших актантів відбувається після порівняння СінП з семантичним словником, тому четверта позиція в цьому блоці, як правило, не заповнюється.
Четвертий блок СінАн
Цей блок складається з двох частин. В першій частині оброблюються придієслівні займенникові клітики. Ця частина являє собою алгоритм, що використовує правила аналізу, складені на основі способу опису використання цього типу одиниць у французькій мові, запропонованого Л.Н.Іорданською в доповіді на семінарі в ІНФОРМЕЛЕКТРО в 1978р. Новим в цьому способі опису є поняття синтаксично опорного слова. В системі ФРАП був використаний фактичний матеріал. Різниця полягає лише в тому, що в оригіналі правила були сформульовані для аналізу фільтрового типу, а в системі ФРАП вони використовуються по-іншому: елементом синтаксичної структури вважається зв’язок займенника з своїм опорним словом, а всі можливі семантичні господарі вираховуються за синтаксичними зв’язками у відповідності з правилами. Інформація про семантичних господарів використовується в СемАн при заповненні їх валентностей.
Друга частина четвертого блоку призначена для вирахування керуючих для тих вузлів, які є або можуть бути сирконстантами у відповідності з інформацією з позиційної таблиці. В якості керуючих для таких вузлів перераховуються всі можливі кандидати, що допущені синтаксичною структурою вже побудованою частиною СінП і властивостями самої сирконстанти. Друга частина четвертого блоку використовується також для уточнення СінП у відповідності з результатами СемАн.