安装elasticsearch搜索工具并配置python驱动的方法

elasticsearch是一个基于lucene的搜索服务器。它提供了一个分布式多用户能力的全文搜索引擎,基于restful web接口。elasticsearch是用java开发的,并作为apache许可条款下的开放源码发布,是第二流行的企业搜索引擎。设计用于云计算中,能够达到实时搜索,稳定,可靠,快速,安装使用方便。
我们建立一个网站或应用程序,并要添加搜索功能,令我们受打击的是:搜索工作是很难的。我们希望我们的搜索解决方案要快,我们希望有一个零配置和一个完全免费的搜索模式,我们希望能够简单地使用json通过http的索引数据,我们希望我们的搜索服务器始终可用,我们希望能够一台开始并扩展到数百,我们要实时搜索,我们要简单的多租户,我们希望建立一个云的解决方案。elasticsearch旨在解决所有这些问题和更多的问题。
elasticsearch 是开源搜索平台的新成员,实时数据分析的神器,发展迅猛,基于 lucene、restful、分布式、面向云计算设计、实时搜索、全文搜索、稳定、高可靠、可扩展、安装+使用方便,介绍都说的很好听,好不好用拿出来遛一遛。
做了个简单测试,在两台完全一样的虚拟机上,2000万条左右数据,elasticsearch 插入数据速度比 mongodb 慢很多(可以忍受),但是搜索/查询速度快10倍以上,这只是单机情况,多机集群情况下 elasticsearch 表现更好一些。以下安装步骤在 ubuntu server 14.04 lts 上完成。

安装 elasticsearch
升级系统后安装 oracle java 7,既然 elasticsearch 官方推荐使用 oracle jdk 7 就不要尝试 jdk 8 和 openjdk 了:

$ sudo apt-get update
$ sudo apt-get upgrade
$ sudo apt-get install software-properties-common
$ sudo add-apt-repository ppa:webupd8team/java
$ sudo apt-get update
$ sudo apt-get install oracle-java7-installer

加入 elasticsearch 官方源后安装 elasticsearch:

$ wget -o – http://packages.elasticsearch.org/gpg-key-elasticsearch | apt-key add –
$ sudo echo “deb http://packages.elasticsearch.org/elasticsearch/1.1/debian stable main” >> /etc/apt/sources.list
$ sudo apt-get update
$ sudo apt-get install elasticsearch

加入到系统启动文件并启动 elasticsearch 服务,用 curl 测试一下安装是否成功:

$ sudo update-rc.d elasticsearch defaults 95 1
$ sudo /etc/init.d/elasticsearch start
$ curl -x get ‘http://localhost:9200’
{
“status” : 200,
“name” : “fer-de-lance”,
“version” : {
“number” : “1.1.1”,
“build_hash” : “f1585f096d3f3985e73456debdc1a0745f512bbc”,
“build_timestamp” : “2014-04-16t14:27:12z”,
“build_snapshot” : false,
“lucene_version” : “4.7”
},
“tagline” : “you know, for search”
}

elasticsearch 的集群和数据管理界面 marvel 非常赞,可惜只对开发环境免费,如果这个工具也免费就无敌了,安装很简单,完成后重启服务访问 http://192.168.2.172:9200/_plugin/marvel/ 就可以看到界面:

$ sudo /usr/share/elasticsearch/bin/plugin -i elasticsearch/marvel/latest
$ sudo /etc/init.d/elasticsearch restart
* stopping elasticsearch server [ ok ]
* starting elasticsearch server [ ok ]

20151222145816902.png (550×473)

安装 python 客户端驱动
和 mongodb 一样,我们一般用程序和 elasticsearch 交互,elasticsearch 也支持多种语言的客户端驱动,这里仅安装 python 驱动,其他语言可以参考官方文档。

$ sudo apt-get install python-pip
$ sudo pip install elasticsearch

写个简单程序把 gene_info.txt 的数据导入到 elasticsearch:

#!/usr/bin/python
# -*- coding: utf-8 -*-
import os, os.path, sys, re
import csv, time, string
from datetime import datetime
from elasticsearch import elasticsearch
def import_to_db():
data = csv.reader(open(‘gene_info.txt’, ‘rb’), delimiter=’\t’)
data.next()
es = elasticsearch()
for row in data:
doc = {
‘tax_id’: row[0],
‘geneid’: row[1],
‘symbol’: row[2],
‘locustag’: row[3],
‘synonyms’: row[4],
‘dbxrefs’: row[5],
‘chromosome’: row[6],
‘map_location’: row[7],
‘description’: row[8],
‘type_of_gene’: row[9],
‘symbol_from_nomenclature_authority’: row[10],
‘full_name_from_nomenclature_authority’: row[11],
‘nomenclature_status’: row[12],
‘other_designations’: row[13],
‘modification_date’: row[14]
}
res = es.index(index=”gene”, doc_type=’gene_info’, body=doc)
def main():
import_to_db()
if __name__ == “__main__”:
main()

kibana 是一个功能强大的数据显示客户端,通过插件方式和 elasticsearch 集成在一起,安装很容易,下载解压就可以了,然后重启 elasticsearch 服务访问 http://192.168.2.172:9200/_plugin/kibana/ 就能看到界面:

$ wget https://download.elasticsearch.org/kibana/kibana/kibana-3.0.1.tar.gz
$ tar zxvf kibana-3.0.1.tar.gz
$ sudo mv kibana-3.0.1 /usr/share/elasticsearch/plugins/_site
$ sudo /etc/init.d/elasticsearch restart

20151222145853839.png (550×473)

Posted in 未分类

发表评论