алгоритм выявления в документе табличных данных?
- From
- Pavel Berezin ()
- To
- All
- Date
- 2002-12-16T08:10:13Z
- Area
- RU.ALGORITHMS
From: "Pavel Berezin" <pberezin@iwc.8k.com>
Доброго дня, ALL!
Подскажите, есть ли какая-то математика для сабжа:
имеется набор экселевских табличек, на каждом листе есть таблицы
(произвольного вида и размера) и нетабличные данные (титульные строчки,
пояснения, подписи и т.п.)...необходимо както "пройтись" математикой по
листу, и выявить границы табличных данных.
Нечто подобное с успехом делает Fine Reader, перед тем как распознавать
сканированный бумажный документ.
Есть ли какие-то материалы по такой теме?
З.Ы. для упрощения полагаем: что алгоритм имеет доступ к любой ячейке
листа, а данные хранятся по принципу "одно значение - одна ячейка листа",
причем в колонках таблиц только однотипные (т.е. не будет текст в перемешку
с цифрами/датами в одной колонке)...и не факт что табличная часть ограничена
"красивыми рамочками" (границы ячеек и так видны на экране)
--- ifmail v.2.15dev5
* Origin: Demos online service (2:5020/400)