使用Mongo Map/Reduce获取子字典值

0 投票
1 回答
723 浏览
提问于 2025-04-16 23:12

我有一个MongoDB的集合,我想根据给定的网站名称、时间戳和变体ID来获取“广告点击次数”的总值。因为我们的数据量很大,所以使用map/reduce会更好。有没有人能给我一些建议?

这是我的集合的JSON格式

{ "_id" : ObjectId( "4e3c280ecacbd1333b00f5ff" ),
  "timestamp" : "20110805",
  "variants" : { "94" : { "number_of_ad_clicks" : 41,
      "number_of_search_keywords" : 9,
      "total_duration" : 0,
      "os" : { "os_2" : 2,
        "os_1" : 1,
        "os_0" : 0 },
      "countries" : { "ge" : 6,
        "ca" : 1,
        "fr" : 8,
        "uk" : 4,
        "us" : 6 },
      "screen_resolutions" : { "(320, 240)" : 1,
        "(640, 480)" : 5,
        "(1024, 960)" : 5,
        "(1280, 768)" : 5 },
      "widgets" : { "widget_1" : 1,
        "widget_0" : 0 },
      "languages" : { "ua_uk" : 8,
        "ca_en" : 2,
        "ca_fr" : 2,
        "us_en" : 5 },
      "search_keywords" : { "search_keyword_8" : 8,
        "search_keyword_5" : 5,
        "search_keyword_4" : 4,
        "search_keyword_7" : 7,
        "search_keyword_6" : 6,
        "search_keyword_1" : 1,
        "search_keyword_3" : 3,
        "search_keyword_2" : 2 },
      "number_of_pageviews" : 18,
      "browsers" : { "browser_4" : 4,
        "browser_0" : 0,
        "browser_1" : 1,
        "browser_2" : 2,
        "browser_3" : 3 },
      "keywords" : { "keyword_5" : 5,
        "keyword_4" : 4,
        "keyword_1" : 1,
        "keyword_0" : 0,
        "keyword_3" : 3,
        "keyword_2" : 2 },
      "number_of_keyword_clicks" : 83,
      "number_of_visits" : 96 } },
  "site_name" : "fonter.com",
  "number_of_variants" : 1 }

这是我尝试过的,但失败了。

m = function() {
    emit(this.query, {variants: this.variants});
}

r = function(key , vals) {
    var clicks = 0 ;
    for(var i = 0; i < vals.length(); i++){
        clicks = vals[i]['number_of_ad_clicks'];
    }
    return clicks;
}
res = db.variant_daily_collection.mapReduce(m, r, {out : "myoutput", "query":{"site_name": 'fonter.com', 'timestamp': '20110805'}})
db.myoutput.find()

有没有人能给我一些建议?

非常感谢,我尝试了你们的解决方案,但没有任何返回结果。我用以下方式调用了mapreduce,是否有什么问题?

res = db.variant_daily_collection.mapReduce(map, reduce, {out : "myoutput", "query":{"site_name": 'facee.com', 'timestamp': '20110809', 'variant_id': '305'}})
db.myoutput.find()

1 个回答

0

emit函数会同时发出一个key和一个value

如果你熟悉SQL,可以把key想象成你的GROUP BY,而value则像是你的SUM()AVG()等。

在你的情况下,你想要“分组”的内容是:网站名称、时间戳和变体ID。看起来你可能有多个变体,所以你需要循环遍历这些变体,像这样:

map = function() {
  for(var i in variants){
    var key = {};
    key.timestamp = this.timestamp;
    key.site_name = this.site_name;
    key.variant_id = i; // that's the "94" string.

    var value = {};
    value.clicks = this.variants[i].number_of_ad_clicks;

    emit(key, value);
  }
}

reduce函数会接收到一个值的数组,每个值的格式像这样{ clicks: 41 }。这个函数需要返回一个看起来相同的对象。

所以如果你得到values = [ {clicks:21}, {clicks:10}, {clicks:5} ],你必须输出{clicks:36}

所以你可以这样做:

reduce = function(key , vals) {
    var returnValue = { clicks: 0 }; // initializing to zero
    for(var i = 0; i < vals.length(); i++){
        returnValue.clicks += vals[i].clicks;
    }
    return returnValue;
}

注意,来自mapvaluereduce的返回值格式是一样的。

撰写回答