Re: Log files

From
Roman Vasin ()
To
All
Date
2000-03-03T21:23:06Z
Area
RU.ALGORITHMS
From: "Roman Vasin" <vasin@kaluga.ru>

> Нельзя ли покоректней поставить задачу.
> а) Т.е. сколько это "несколько миллионов" - 1, 2, 5, 10 млн. или больше.
у 90% людей с которыми я контактирую, уникальных ip адресов не так уж много
~100.000 т.е. задача в принципе решается использованием линейного списка, но
вот есть 10%, у которых 5млн. и более, проблема в том, чтобы оптимизировать
анализатор для супер больших логов


Ведь эти 10% всетаки хотят получать статистику. Вот почему я писал о
"приближенном" методе поиска. Т.е. для таких больших логов не обязательно
знать точные цифры, достаточно знать тенденцию - куда дело движется.

>    т.к. IP адрес - это 4 байта 1 млн. - соответственно 4 Мб ( почти :) )
В том то все и дело :) дошло?

> б) Какой объем памяти можно занять под эту задачу
5Гб (если анализатор работает на клиентской стороне, т.е. на своем
компьютере), ~50Мб если он работает как cgi приложение у провайдера.

> в) Какое время можно выделить под задачу. (Т.е. к примеру максиму за 10
минут
> должен быть получен результат или сколько )

> б) И каким образом собирается статистика. Т.е. каждый день например в
00:00
> сканируется лог файл и создаётся отсчёт или ещё как?
Вообще это как заблагорассудится, есть любители, которые анализируют логи
накопленные за пол года. Хотя чаще всего - 1 раз в день, и логи за 1
неделю/месяц.

> в) Сколько примерно адресов добавляется от сканирования к сканированию?
10.000-30.000


--
Роман Васин,                          Калуга,    vasin@kaluga.ru
Home:      http://www.geocities.com/CapeCanaveral/2971/




--- ifmail v.2.15dev4
 * Origin: Demos online service (2:5020/400)