Log files
- From
- Valeriy Shabanov (2:5055/138.9)
- To
- Roman Vasin
- Date
- 2000-03-03T00:18:47Z
- Area
- RU.ALGORITHMS
Приветик, *Roman*.
Сpеда Mapт 01 2000 20:20, Roman Vasin топтал клаву для All:
RV> Возникла очень интересная алгоритмическая задача:
RV> Есть лог файл, задача - найти самые встречающиеся ip адреса, т.е.
RV> получить
RV> отчет типа:
RV> ip count
RV> -----------------------------
RV> 195.12.12.12 20
RV> 203.12.32.23. 15
RV> 195.64.23.105 8
RV> Проблема в том, что этот список может быть очень большым - несколько
RV> миллионов, это:
RV> 1. Занимает большое количество памяти.
RV> 2. Значительно замедляет анализ, т.к. при добавлении нового ip необходимо
RV> полностью просмотреть список.
Нельзя ли покоректней поставить задачу.
а) Т.е. сколько это "несколько миллионов" - 1, 2, 5, 10 млн. или больше.
т.к. IP адрес - это 4 байта 1 млн. - соответственно 4 Мб ( почти :) )
б) Какой объем памяти можно занять под эту задачу
в) Какое время можно выделить под задачу. (Т.е. к примеру максиму за 10 минут
должен быть получен результат или сколько )
б) И каким образом собирается статистика. Т.е. каждый день например в 00:00
сканируется лог файл и создаётся отсчёт или ещё как?
в) Сколько примерно адресов добавляется от сканирования к сканированию?
Пока, _Valeriy_.
/[Team VSTU] [Team Borman C++ Builder] [Team OOP]/
... -=- Alien -=-
---
* Origin: Эллипс - это круг, вписанный в квадрат два на четыре. (2:5055/138.9)