алгоритм выявления в документе табличных данных?

From
Pavel Berezin ()
To
All
Date
2002-12-16T08:10:13Z
Area
RU.ALGORITHMS
From: "Pavel Berezin" <pberezin@iwc.8k.com>


Доброго дня, ALL!

Подскажите, есть ли какая-то математика для сабжа:
имеется набор экселевских табличек, на каждом листе есть таблицы
(произвольного вида и размера) и нетабличные данные (титульные строчки,
пояснения, подписи и т.п.)...необходимо както "пройтись" математикой по
листу, и выявить границы табличных данных.
Нечто подобное с успехом делает Fine Reader, перед тем как распознавать
сканированный бумажный документ.

Есть ли какие-то материалы по такой теме?

З.Ы. для упрощения полагаем:  что алгоритм имеет доступ к любой ячейке
листа, а данные хранятся по принципу "одно значение - одна ячейка листа",
причем в колонках таблиц только однотипные (т.е. не будет текст в перемешку
с цифрами/датами в одной колонке)...и не факт что табличная часть ограничена
"красивыми рамочками" (границы ячеек и так видны на экране)



--- ifmail v.2.15dev5
 * Origin: Demos online service (2:5020/400)