简化布隆过滤器——bitmap

前言

前段开发项目试就发现,一部分的代码实现存在着一些性能上的隐患。但当时忙于赶进度和由于卡发中的不稳定因素,想了许多解决方案也没有机会实施。最近,正好趁个机会进行一系列的改进。

我在团队开发中负责开发服务器端。所以在编写业务逻辑层时,常常遇到以下这样的业务逻辑:
1. 判断一个用户是否为在自己的好友列表中
2. 判断一条动态是否已被用户翻阅
3. 判断两个用户的标签的匹配度
4. .....等等
这些情况,我之前的方案是采用数据库来解决,为每条记录添加标记,需要查询时则遍历返回相应的集合

但是随着用户量的不断增多、各个用户之间的关系不断地增加、以及用户使用软件的一系列行为中这些情况是非常频繁的,这样频繁遍历大量的记录的读操作会给数据库带来难以承受的压力。

那么如何需找一种更好的解决方案?
既能减少数据库需要遍历的记录数量且快速索引,又能用少量的内存表示大量的数据。
其实如果我们对这一类型的业务逻辑进行抽象,可以得到:本质上就是判断一个元素是否存在于集合中
所以我们可以采用位数组,通过数组的下标能快速地定位某个元素,用bit表示相应的内容能够节省大量的空间。

但是这样结构依旧不够完美,如果数据量相对较少,数组中会存在大量的无用数据, 如长度为1024的byte数组中的只有少量位被表示为1,大量位依然是0。
此时我们可以采用游程编码压缩byte数组。如上图的游程编码后的结果可以表示为[3, 0, 2, 0, 2, 0, 1, 0 ]

bitmap介绍

bitmap:被设计为一种用bit数组来储存表示2种状态紧凑、快速索引的数据结构(当然Java的util包中也实现这类型的数据结构—BitSet(不过并不是Set))

bitmap主要原理

其实说开来,bitmap就是一个位数组而已,有着快速访问优势(下标访问),以及极小占用(用1bit来表示)

bitmap的主要设计

有点美中不足的是,Java中并没有提供bit这样的数据类型,即便是最小的数据类型byte也要占用8bit。这样就需要进行一些位运算来完成相应的操作,使得代码变得稍微复杂。
1. bitmap的内部通过byte数组实现
2. bitmap的基本操作:增删改查

    void  Set(int  position);       /* 将某位置"1" */
    boolean  Get(int  position);    /* 判断某位的值 */
    void  Clear(int  postion);      /* 将某位置"0" */

Set()的实现原理

废话不多说,直接看图



主要分为两个步骤:

  1. 先将一个byte类型的"1"左移4位,得到结果
  2. 再进行简单的或运算,得到结果并覆盖原来的值

Get()的实现原理


理解了上面的例子,相信这个应该就很简单了
同样是两步:

  1. 先将一个byte类型的"1"左移3位,得到结果
  2. 再进行与操作,得到结果并覆盖原来的值

或许这里会有些疑问,为什么不考虑用boolean?
首先,Java规范中没有强制规定boolean所占内存的大小。而且大部分计算机允许分配的最小内存单元为8bit

可以用运用bitmap解决问题的实用场景

大多可以运用的场景主要是两个方面:
这里以标签匹配为例子,开发中一个用户与各个用户之间的标签匹配度是令人头疼的问题,通过匹配标签字符串或者标签ID,这样的效果都不能太让人满意,在数据库中的保存也颇为麻烦。

一、快速索引

假如,每个用户都有一个这样小小的长度为40的byte数组,那么用户就可以用它来表示320种标签。而且能够快速的查询,通过bitarray[tag_id]这样的访问方式可以极快查到,用户是否选取了这个标签,能够快速地计算与各个用户之间的标签匹配度

二、数据压缩

那么像第一点说的那样,长度为40的byte数据便可以保存320种标签信息,但它内存大小只有40B。而且这还是没有进行游程编码压缩之前的大小

Java实现

/**
 * Created by 某拆迁大队的二哈 on 17-6-7.
 */
public class BitMap {

    public static final int DEFAULT_SIZE = 1024;

    public static final boolean EXIST = true;

    public static final boolean NULL = false;

    public static final short bits = 8;

    private byte[] bitArray;

    private int size;

    public BitMap(){
        this(DEFAULT_SIZE);
    }

    public BitMap(byte[] bitArray){
        this.size = bitArray.length * bits;
        this.bitArray = bitArray;
    }

    public BitMap(int defaultSize) {
        this.size = defaultSize * bits;
        this.bitArray = new byte[defaultSize];
    }

    public BitMap(int size, boolean elem){
        this(size);

        if(EXIST == elem) {
            for (int i = 0; i < bitArray.length; i++)
                bitArray[i] = (byte) ~bitArray[i];
        }
    }

    public int size(){
        return size;
    }

    public int index(int position){
        int idx = (position + bits - 1) / bits; 
        return idx - 1;
    }

    public int offset(int position){
        int ofs = position % 8;
        return (ofs == 0 ? ofs : 8 - ofs);
    }

    public void setBit(int position){
        if(position > size)
            return ;

        int idx = index(position);
        int ofs = offset(position);
        bitArray[idx] |= (byte)(1 << ofs);
    }

    public boolean getBit(int position){
        if(position > size)
            return false;

        int idx = index(position);
        int ofs = offset(position);
        byte tmp = (byte)(bitArray[idx] & (1 << ofs));

        return tmp != 0;
    }

    public void setBitArray(byte[] bitArray){
        this.bitArray = bitArray;
    }

    public byte[] getBitArray(){
        return bitArray;
    }

    public String byteToStr(int position){
        byte b = bitArray[index(position)];

        StringBuffer sb = new StringBuffer("");
        for(int i=bits-1; i>-1; i--)
            sb.append((byte)((b >> i) & 0x1));
        return sb.toString();
    }
}
最后编辑于
©著作权归作者所有,转载或内容合作请联系作者
  • 序言:七十年代末,一起剥皮案震惊了整个滨河市,随后出现的几起案子,更是在滨河造成了极大的恐慌,老刑警刘岩,带你破解...
    沈念sama阅读 159,015评论 4 362
  • 序言:滨河连续发生了三起死亡事件,死亡现场离奇诡异,居然都是意外死亡,警方通过查阅死者的电脑和手机,发现死者居然都...
    沈念sama阅读 67,262评论 1 292
  • 文/潘晓璐 我一进店门,熙熙楼的掌柜王于贵愁眉苦脸地迎上来,“玉大人,你说我怎么就摊上这事。” “怎么了?”我有些...
    开封第一讲书人阅读 108,727评论 0 243
  • 文/不坏的土叔 我叫张陵,是天一观的道长。 经常有香客问我,道长,这世上最难降的妖魔是什么? 我笑而不...
    开封第一讲书人阅读 43,986评论 0 205
  • 正文 为了忘掉前任,我火速办了婚礼,结果婚礼上,老公的妹妹穿的比我还像新娘。我一直安慰自己,他们只是感情好,可当我...
    茶点故事阅读 52,363评论 3 287
  • 文/花漫 我一把揭开白布。 她就那样静静地躺着,像睡着了一般。 火红的嫁衣衬着肌肤如雪。 梳的纹丝不乱的头发上,一...
    开封第一讲书人阅读 40,610评论 1 219
  • 那天,我揣着相机与录音,去河边找鬼。 笑死,一个胖子当着我的面吹牛,可吹牛的内容都是我干的。 我是一名探鬼主播,决...
    沈念sama阅读 31,871评论 2 312
  • 文/苍兰香墨 我猛地睁开眼,长吁一口气:“原来是场噩梦啊……” “哼!你这毒妇竟也来了?” 一声冷哼从身侧响起,我...
    开封第一讲书人阅读 30,582评论 0 198
  • 序言:老挝万荣一对情侣失踪,失踪者是张志新(化名)和其女友刘颖,没想到半个月后,有当地人在树林里发现了一具尸体,经...
    沈念sama阅读 34,297评论 1 242
  • 正文 独居荒郊野岭守林人离奇死亡,尸身上长有42处带血的脓包…… 初始之章·张勋 以下内容为张勋视角 年9月15日...
    茶点故事阅读 30,551评论 2 246
  • 正文 我和宋清朗相恋三年,在试婚纱的时候发现自己被绿了。 大学时的朋友给我发了我未婚夫和他白月光在一起吃饭的照片。...
    茶点故事阅读 32,053评论 1 260
  • 序言:一个原本活蹦乱跳的男人离奇死亡,死状恐怖,灵堂内的尸体忽然破棺而出,到底是诈尸还是另有隐情,我是刑警宁泽,带...
    沈念sama阅读 28,385评论 2 253
  • 正文 年R本政府宣布,位于F岛的核电站,受9级特大地震影响,放射性物质发生泄漏。R本人自食恶果不足惜,却给世界环境...
    茶点故事阅读 33,035评论 3 236
  • 文/蒙蒙 一、第九天 我趴在偏房一处隐蔽的房顶上张望。 院中可真热闹,春花似锦、人声如沸。这庄子的主人今日做“春日...
    开封第一讲书人阅读 26,079评论 0 8
  • 文/苍兰香墨 我抬头看了看天上的太阳。三九已至,却和暖如春,着一层夹袄步出监牢的瞬间,已是汗流浃背。 一阵脚步声响...
    开封第一讲书人阅读 26,841评论 0 195
  • 我被黑心中介骗来泰国打工, 没想到刚下飞机就差点儿被人妖公主榨干…… 1. 我叫王不留,地道东北人。 一个月前我还...
    沈念sama阅读 35,648评论 2 274
  • 正文 我出身青楼,却偏偏与公主长得像,于是被迫代替她去往敌国和亲。 传闻我的和亲对象是个残疾皇子,可洞房花烛夜当晚...
    茶点故事阅读 35,550评论 2 270

推荐阅读更多精彩内容

  • Spring Cloud为开发人员提供了快速构建分布式系统中一些常见模式的工具(例如配置管理,服务发现,断路器,智...
    卡卡罗2017阅读 134,100评论 18 139
  • 国家电网公司企业标准(Q/GDW)- 面向对象的用电信息数据交换协议 - 报批稿:20170802 前言: 排版 ...
    庭说阅读 10,505评论 6 13
  • 1. Java基础部分 基础部分的顺序:基本语法,类相关的语法,内部类的语法,继承相关的语法,异常的语法,线程的语...
    子非鱼_t_阅读 31,293评论 18 399
  • 前言 台湾这几年,随时可见各种资方与劳方对立的新闻。多年没有调薪,连大学教师都出来争取自己的权益。在资方的自我意识...
    高浩容阅读 1,760评论 2 5
  • harrytc阅读 205评论 0 0