Fusion tree — различия между версиями

Версия 17:42, 11 июня 2013

Fusion tree — дерево поиска, позволяющее хранить [math]n[/math] [math]w[/math]-битных положительных чисел, используя [math]O(n)[/math] памяти, и выполнять операции поиска за время [math]O(\log_{w} n)[/math]. Эта структура данных была впервые предложенна в 1990 году М. Фредманом (M. Fredman) и Д. Уиллардом (D. Willard).

Содержание

1 Структура
2 Поиск вершины
- 2.1 Параллельное сравнение
- 2.2 Succ(q) и pred(q)
3 Вычисление sketch(x)
4 Индекс наиболее значащего бита
5 Ссылки

Структура

Fusion tree — это B-дерево, такое что:

у всех вершин, кроме листьев, [math]B = w^{1/5}[/math] детей;
время, за которое определяется в каком поддереве находится вершина, равно [math]O(1)[/math].

Такое время работы достигается за счет хранения дополнительной информации в вершинах. Построим цифровой бор из ключей узла дерева. Всего [math]B - 1[/math] ветвящихся вершин. Биты, соответствующие уровням дерева, в которых происходит ветвление, назовем существенными и обозначим их номера [math]b_1, b_2\ldots b_r[/math]. Количество существенных битов [math]r[/math] не больше чем [math]B - 1[/math].

В Fusion tree вместе с ключом [math]x[/math] хранится [math]sketch(x)[/math] - последовательность битов [math]x_{b_{r-1}}\ldots x_{b_0}[/math].

Утверждение:

сохраняет порядок, то есть , если .

Рассмотрим наибольший общий префикс и . Тогда следующий бит определяет их порядок и одновременно является существенным битом.

Поиск вершины

Пусть - множество ключей узла, отсортированных по возрастанию, [math]q[/math] - ключ искомой вершины, [math]l[/math] - количество бит в [math]sketch(q)[/math]. Сначала найдем такой ключ [math]a_i[/math], что . Но положение [math]sketch(q)[/math] среди [math]sketch(a_j)[/math] не всегда эквивалентно положению [math]q[/math] среди [math]a_j[/math], поэтому, зная соседние элементы [math]sketch(q)[/math], найдем [math]succ(q)[/math] и [math]pred(q)[/math].

Параллельное сравнение

Сначала найдем [math]succ(sketch(q))[/math] и [math]pred(sketch(q))[/math]. Определим [math]sketch(node)[/math] как число, составленное из едениц и [math]sketch(a_i)[/math], то есть . Вычтем из [math]sketch(node)[/math] число . В начале каждого блока, где , сохранятся еденицы. Применим к получившемуся побитовое [math]AND[/math] c , чтобы убрать лишние биты.

AND

Если [math]sketch(a_i)\lt sketch(q)[/math], то [math]c_i = 0[/math], в противном случае [math]c_i = 1[/math]. Теперь надо найти количество едениц в L. Умножим L на , тогда все еденицы сложатся в первом блоке результата, и, чтобы получить количество едениц, сдвинем его вправо.

Succ(q) и pred(q)

Пусть .

Утверждение:

Среди всех ключей наибольший общий префикс с будет иметь или или .

Педположим, что имеет наибольший общий префикс с . Тогда будет иметь больше общих битов со . Значит, ближе по значению к , чем или , что приводит к противоречию.

Сравнивая [math]a[/math] XOR [math]q[/math] и [math]b[/math] XOR [math]q[/math], найдем какой из ключей имеет наибольший общий префикс с [math]q[/math] (наименьшнее значение соответствует наибольшей длине).

Предположим, что [math]p[/math] - наибольший общий перфикс, а [math]y[/math] его длина, [math]a_j[/math] - ключ, имеющий наибольший общий префикс с [math]q[/math] ([math]j = i[/math] или [math]i+1[/math]).

если [math]q\gt a_j[/math], то [math]y + 1[/math] бит [math]q[/math] равен еденице, а [math]y + 1[/math] бит [math]a_j[/math] равен нулю. Так как общий префикс [math]a_j[/math] и [math]q[/math] является наибольшим, то не существет ключа с префиксом [math]p1[/math]. Значит, [math]q[/math] больше всех ключей с префиксом меньшим либо равным [math]p[/math]. Найдем [math]pred(e)[/math], [math]e = p01\ldots 11[/math], который одновременно будет [math]равен pred(q)[/math];
если [math]q\lt a_j[/math] - найдем [math]succ(e)[/math], [math]e = p10\ldots 00[/math]. Это будет [math]succ(q)[/math].

Длина наибольшего общего префикса двух w-битных чисел [math]a[/math] и [math]b[/math] может быть вычислена с помощью нахождения индекса наиболее значащего бита в побитовом XOR [math]a[/math] и [math]b[/math].

Вычисление sketch(x)

Чтобы найти sketch за константное время, будем вычислять [math]sketch(x)[/math], имеющий все существенные биты в нужном порядке, но содержащий лишние нули.

1) уберем все несущественные биты [math]x' = x[/math] AND ;

2) умножением на некоторое число сместим все существенные биты в блок меньшего размера

;

3) применив побитовое AND уберем лишние биты, появившиеся в результате умножения;

;

4) сделаем сдвиг вправо на [math]m_0 + b_0[/math] бит.

Утверждение:

Дана последовательность из r чисел . Тогда существует последовательность , такая что:

1) все [math]b_i + m_j[/math] различны, для ;

2) ;

3) .

Выберем некоторые [math]m_i'[/math], таким образом, чтобы . Предположим, что мы выбрали [math]m_1' \ldots m_{t-1}'[/math]. Тогда . Всего недопустимых значений для [math]m_t'[/math], поэтому всегда можно найти хотя бы одно значение.

Чтобы получить , выбираем каждый раз наименьшее и прибавляем подходящее число кратное , такое что .

Первые два условия необходимы для того, чтобы сохранить все существенные биты в нужном порядке. Третье условие позволит поместить sketch узла в w-битный тип. Так как [math]r \leqslant B-1[/math], то [math]sketch(node)[/math] будет занимать бит.

Индекс наиболее значащего бита

Чтобы найти в w-битном числе x индекс самого старшего бита, содержащего еденицу, разделим x на [math]\sqrt{w}[/math] блоков по [math]\sqrt{w}[/math] бит. . Далее найдем первый непустой блок и индекс первого еденичного бита в нем.

1)Поиск непустых блоков.

a. Определим какие блоки имеют еденицу в первом бите. Применим побитовое AND к x и константой F

b. Определим, содержат ли остальные биты еденицы.

Вычислим [math]x\; XOR \; t_1[/math].

Вычтем от [math]F\; t_2[/math]. Если какой-нибудь бит [math]F[/math] обнулится, значит, соответствующий блок содержит еденицы.

Чтобы найти блоки, содержащие еденицы, вычислим [math]t_3\; XOR \; F[/math].

c. Первый бит в каждом блоке [math]y = t_1\; OR \;t_4[/math] содержит еденицу, если соответствующий блок x ненулевой.

2) найдем sketch(y), чтобы сместить все нужные биты в один блок. Существенными битами в данном случае будут первые биты каждого блока, поэтому .

Будем использовать . Тогда . Все суммы различны при . Все [math]b_i + m_i = w + i[/math] возрастают, и . Чтобы найти sketch(y), умножим y на m и сдвинем вправо на w бит.

3)Найдем первый ненулевой блок. Для этого надо найти первую еденицу в sketch(y). Как и при поиске succ(sketch(q)) и pred(sketch(q)) используем параллельное сравнение sketch(y) с . В результате сравнения получим номер первого ненулевого блока [math]c[/math].

4) найдем номер [math]d[/math] первого еденичного бита в найденном блоке так же как и в предыдущем пункте.

5) инедекс наиболее значащего бита будет равен [math]c\sqrt{w}+d[/math].

Каждый шаг выполняется за [math]O(1)[/math], поэтому всего потребуется [math]O(1)[/math] времени, чтобы найти индекс.

Ссылки

M. L. Fredman and D. E. Willard. Surpassing the information theoretic barrier with fusion trees. Journal of Computer and System Sciences, 1993

MIT CS 6.897: Advanced Data Structures: Lecture 4, Fusion Trees, Prof. Erik Demaine (Spring 2003)

MIT CS 6.851: Advanced Data Structures: Lecture 12, Fusion Tree notes, Prof. Erik Demaine (Spring 2012)

А.С. Станкевич. Дополнительные главы алгоритмов, лекция 6

Wikipedia — Fusion tree

@@ Строка 28: / Строка 28: @@
 Теперь надо найти количество едениц в ''L''. Умножим ''L'' на <tex>\underbrace{0\ldots 01}_{l + 1 bits}\ldots \underbrace{0\ldots 01}_{l+1 bits}</tex>, тогда все еденицы сложатся в первом блоке результата, и, чтобы получить количество едениц, сдвинем его вправо.
 ===Succ(q) и pred(q)===
-Пусть <tex>sketch(a_i) \leqslant sketch(q) \leqslant sketch(a_{i+1})</tex>. Среди всех ключей наибольший общий префикс с <tex>q</tex> будет иметь или <tex>a_i</tex> или <tex>a_{i+1}</tex>. Сравнивая <tex>a\;XOR\;q</tex> и <tex>b\;XOR\;q</tex>, найдем какой из ключей имеет наибольший общий префикс с <tex>q</tex> (наименьшнее значение соответствует наибольшей длине).
+Пусть <tex>sketch(a_i) \leqslant sketch(q) \leqslant sketch(a_{i+1})</tex>.
+{{Утверждение
+|id=prefix.
+|author=
+|about=
+|statement=Среди всех ключей наибольший общий префикс с <tex>q</tex> будет иметь или <tex>a_i</tex> или <tex>a_{i+1}</tex>.
+|proof=
+Педположим, что <tex>y</tex> имеет наибольший общий префикс с <tex>q</tex>. Тогда <tex>sketch(q)</tex> будет иметь больше общих битов со <tex>sketch(y)</tex>. Значит, <tex>sketch(y)</tex> ближе по значению к <tex>sketch(q)</tex>, чем <tex>sketch(a_i)</tex> или <tex>sketch(a_{i+1})</tex>, что приводит к противоречию.
+}}
+Сравнивая <tex>a</tex> ''XOR'' <tex>q</tex> и <tex>b</tex> ''XOR'' <tex>q</tex>, найдем какой из ключей имеет наибольший общий префикс с <tex>q</tex> (наименьшнее значение соответствует наибольшей длине).
 Предположим, что <tex>p</tex> - наибольший общий перфикс, а <tex>y</tex> его длина, <tex>a_j</tex> - ключ, имеющий наибольший общий префикс с <tex>q</tex> (<tex>j = i</tex> или <tex>i+1</tex>).
-* если <tex>q>a_j</tex>, то <tex>y + 1</tex> бит <tex>q</tex> равен еденице, а <tex>y + 1</tex> бит <tex>a_j</tex> равен 0. Так как общий префикс <tex>a_j</tex> и <tex>q</tex> является наибольшим, то не существет ключа с префиксом <tex>p1</tex>.Значит, <tex>q</tex> больше всех ключей с префиксом меньшим либо равным <tex>p</tex>. Найдем <tex>pred(e)</tex> <tex>e = p01\ldots 11</tex>, который одновременно будет <tex>равен pred(q)</tex>;
+* если <tex>q>a_j</tex>, то <tex>y + 1</tex> бит <tex>q</tex> равен еденице, а <tex>y + 1</tex> бит <tex>a_j</tex> равен нулю. Так как общий префикс <tex>a_j</tex> и <tex>q</tex> является наибольшим, то не существет ключа с префиксом <tex>p1</tex>. Значит, <tex>q</tex> больше всех ключей с префиксом меньшим либо равным <tex>p</tex>. Найдем <tex>pred(e)</tex>, <tex>e = p01\ldots 11</tex>, который одновременно будет <tex>равен pred(q)</tex>;
 * если <tex>q<a_j</tex> - найдем <tex>succ(e)</tex>, <tex>e = p10\ldots 00</tex>. Это будет <tex>succ(q)</tex>.
-Длина наибольшего общего префикса двух ''w''-битных чисел ''a'' и ''b'' может быть вычислена с помощью нахождения индекса наиболее значащего бита в побитовом <tex>XOR</tex> ''a'' и ''b''.
+Длина наибольшего общего префикса двух ''w''-битных чисел <tex>a</tex> и <tex>b</tex> может быть вычислена с помощью нахождения индекса наиболее значащего бита в побитовом ''XOR'' <tex>a</tex> и <tex>b</tex>.
 ==Вычисление sketch(x)==

Fusion tree — различия между версиями

Версия 17:42, 11 июня 2013

Содержание

Структура

Поиск вершины

Параллельное сравнение

Succ(q) и pred(q)

Вычисление sketch(x)

Индекс наиболее значащего бита

Ссылки

Навигация

Персональные инструменты

Пространства имён

Варианты

Просмотры

Ещё

Поиск

Навигация

Инструменты