Re: Log files
- From
- Roman Vasin ()
- To
- All
- Date
- 2000-03-03T21:23:06Z
- Area
- RU.ALGORITHMS
From: "Roman Vasin" <vasin@kaluga.ru>
> Нельзя ли покоректней поставить задачу.
> а) Т.е. сколько это "несколько миллионов" - 1, 2, 5, 10 млн. или больше.
у 90% людей с которыми я контактирую, уникальных ip адресов не так уж много
~100.000 т.е. задача в принципе решается использованием линейного списка, но
вот есть 10%, у которых 5млн. и более, проблема в том, чтобы оптимизировать
анализатор для супер больших логов
Ведь эти 10% всетаки хотят получать статистику. Вот почему я писал о
"приближенном" методе поиска. Т.е. для таких больших логов не обязательно
знать точные цифры, достаточно знать тенденцию - куда дело движется.
> т.к. IP адрес - это 4 байта 1 млн. - соответственно 4 Мб ( почти :) )
В том то все и дело :) дошло?
> б) Какой объем памяти можно занять под эту задачу
5Гб (если анализатор работает на клиентской стороне, т.е. на своем
компьютере), ~50Мб если он работает как cgi приложение у провайдера.
> в) Какое время можно выделить под задачу. (Т.е. к примеру максиму за 10
минут
> должен быть получен результат или сколько )
> б) И каким образом собирается статистика. Т.е. каждый день например в
00:00
> сканируется лог файл и создаётся отсчёт или ещё как?
Вообще это как заблагорассудится, есть любители, которые анализируют логи
накопленные за пол года. Хотя чаще всего - 1 раз в день, и логи за 1
неделю/месяц.
> в) Сколько примерно адресов добавляется от сканирования к сканированию?
10.000-30.000
--
Роман Васин, Калуга, vasin@kaluga.ru
Home: http://www.geocities.com/CapeCanaveral/2971/
--- ifmail v.2.15dev4
* Origin: Demos online service (2:5020/400)