Log files

From
Valeriy Shabanov (2:5055/138.9)
To
Roman Vasin
Date
2000-03-03T00:18:47Z
Area
RU.ALGORITHMS
Приветик, *Roman*.

Сpеда Mapт 01 2000 20:20, Roman Vasin топтал клаву для All:

 RV> Возникла очень интересная алгоритмическая задача:
 RV> Есть лог файл, задача - найти самые встречающиеся ip адреса, т.е.
 RV> получить
 RV> отчет типа:
 RV> ip                                 count
 RV> -----------------------------
 RV> 195.12.12.12                20
 RV> 203.12.32.23.               15
 RV> 195.64.23.105               8

 RV> Проблема в том, что этот список может быть очень большым - несколько
 RV> миллионов, это:
 RV> 1. Занимает большое количество памяти.
 RV> 2. Значительно замедляет анализ, т.к. при добавлении нового ip необходимо
 RV> полностью просмотреть список.

Нельзя ли покоректней поставить задачу.
а) Т.е. сколько это "несколько миллионов" - 1, 2, 5, 10 млн. или больше.
   т.к. IP адрес - это 4 байта 1 млн. - соответственно 4 Мб ( почти :) )
б) Какой объем памяти можно занять под эту задачу
в) Какое время можно выделить под задачу. (Т.е. к примеру максиму за 10 минут 
должен быть получен результат или сколько )
б) И каким образом собирается статистика. Т.е. каждый день например в 00:00  
сканируется лог файл и создаётся отсчёт или ещё как?
в) Сколько примерно адресов добавляется от сканирования к сканированию?

      Пока,  _Valeriy_.

     /[Team VSTU]  [Team Borman C++ Builder]  [Team OOP]/
... -=- Alien -=-
---
 * Origin: Эллипс - это круг, вписанный в квадрат два на четыре. (2:5055/138.9)