mrco
V2EX  ›  问与答

如何提取 web 日志,并存入 mysql? 在线等

  •  
  •   mrco · Jun 25, 2015 · 2578 views
    This topic created in 4069 days ago, the information mentioned may be changed or developed.
    要解决的问题是:
    分析网站的每一次用户的http request日志,匹配日志中的参数name,并将参数value存储到mysql数据库指定的表中。
    如:下面是一次用户访问,table中。
    127.0.0.1 533 [06/Jun/2015:10:26:31 +0800]- - 200 25994 127.0.0.1 8080 GET /xgz/download?_dc=18088889999&source=gdtjf8934h9hee&title=&author=&processName=&page=1&start=0&limit=50

    需要提取的部分是
    _dc
    source
    title

    谢谢!
    Supplement 1  ·  Jun 26, 2015
    #!/bin/sh
    #采集web日志当前时间前一分钟的数据.
    log=/root/log.txt
    tmp=/tmp/last_min_log.log
    year=`date +'%Y'`
    last_min=`date --date="-1 minutes" | awk -F ':' '{print $1":"$2}'|awk '{print $NF}'`
    time_line="$year:$last_min"
    #找出上一分钟的日志内容,写入文件.
    cat $log grep $time_line |grep -v 400 > $tmp
    cat $tmp | while read line
    do
    ip=`echo "$line" | awk '{print $1}'`
    _dc=`echo "$line" | awk -F '?' '{print $2}' | awk -F '&' '{print $1}' | awk -F '=' '{print $2}'`
    source=`echo "$line" | awk -F '?' '{print $2}' | awk -F '&' '{print $2}' | awk -F '=' '{print $2}'`
    title=`echo "$line" | awk -F '?' '{print $2}' | awk -F '&' '{print $3}' | awk -F '=' '{print $2}'`
    echo "$ip $_dc $source $title"
    #插入db
    mysql -h 127.0.0.1 -uapp -p123123 -e "insert into database.table (ip,_dc,source,title) values('$ip','$_dc','$source','$title')"
    done
    9 replies    2015-06-25 23:32:21 +08:00
    babyname
        1
    babyname  
       Jun 25, 2015
    awk
    mongodb
        2
    mongodb  
       Jun 25, 2015
    只能告诉你使用awk..具体怎么弄可以查询awk使用方法。
    mrco
        3
    mrco  
    OP
       Jun 25, 2015
    @babyname awk出来之后如何写入mysql昵?
    cylin
        4
    cylin  
       Jun 25, 2015
    @mrco 存入数据库这部分要用php、python等语言实现了
    ihciah
        6
    ihciah  
       Jun 25, 2015
    import urlparse
    url="127.0.0.1 533 [06/Jun/2015:10:26:31 +0800]- - 200 25994 127.0.0.1 8080 GET /xgz/download?_dc=18088889999&source=gdtjf8934h9hee&title=&author=&processName=&page=1&start=0&limit=50"
    url=url[url.find('?'):]
    d=dict(urlparse.parse_qsl(url))
    print d['_dc']

    记得转义
    ihciah
        7
    ihciah  
       Jun 25, 2015
    @ihciah
    纠正:url=url[url.find('?'):] -> url=url[url.find('?')+1:]
    附插入数据库代码:
    import pymysql
    conn = pymysql.connect(host='localhost', port=3306, user='root', passwd='', db='mylog',charset='utf8')
    cur = conn.cursor()
    p=lambda x:pymysql.escape_string(x)
    cur.execute("INSERT INTO xx(a,b,c) VALUES('%s','%s','%s')" %(p(d['_dc']),p(d['source']),p(d['title'])))
    conn.commit()
    cur.close()
    conn.close()
    mrco
        8
    mrco  
    OP
       Jun 25, 2015
    @ihciah 能否做到实时提取,实时插入昵?
    ihciah
        9
    ihciah  
       Jun 25, 2015
    @mrco 实时是指的什么?
    About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   2981 Online   Highest 6679   ·     Select Language
    创意工作者们的社区
    World is powered by solitude
    VERSION: 3.9.8.5 · 35ms · UTC 08:36 · PVG 16:36 · LAX 01:36 · JFK 04:36
    ♥ Do have faith in what you're doing.