在googleappengin中对多个数据存储类型进行MapReduce

def calculateCorrelation(user, item): return calculateCorrelationAverage(u.tags, i.tags) def calculateCorrelationAverage(tags1, tags2): correlationSum = 0.0 for (tag1, tag2) in allCombinations(tags1, tags2): correlationSum += correlation(tag1, tag2) return correlationSum / (len(tags1) + len(tags2)) def allCombinations(list1, list2): combinations = [] for x in list1: for y in list2: combinations.append((x, y)) return combinations

2条回答

网友

1楼 · 编辑于 2024-06-12 12:25:37

按照尼克·约翰逊的建议，我写了我自己的InputReader。这个读取器从两种不同的类型获取实体。它生成包含这些实体的所有组合的元组。这里是：

class TwoKindsInputReader(InputReader):
    _APP_PARAM = "_app"
    _KIND1_PARAM = "kind1"
    _KIND2_PARAM = "kind2"
    MAPPER_PARAMS = "mapper_params"

    def __init__(self, reader1, reader2):
        self._reader1 = reader1
        self._reader2 = reader2

    def __iter__(self):
        for u in self._reader1:
            for e in self._reader2:
                yield (u, e)

    @classmethod
    def from_json(cls, input_shard_state):
        reader1 = DatastoreInputReader.from_json(input_shard_state[cls._KIND1_PARAM])
        reader2 = DatastoreInputReader.from_json(input_shard_state[cls._KIND2_PARAM])

        return cls(reader1, reader2)

    def to_json(self):
        json_dict = {}
        json_dict[self._KIND1_PARAM] = self._reader1.to_json()
        json_dict[self._KIND2_PARAM] = self._reader2.to_json()
        return json_dict

    @classmethod
    def split_input(cls, mapper_spec):
        params = mapper_spec.params
        app = params.get(cls._APP_PARAM)
        kind1 = params.get(cls._KIND1_PARAM)
        kind2 = params.get(cls._KIND2_PARAM)
        shard_count = mapper_spec.shard_count
        shard_count_sqrt = int(math.sqrt(shard_count))

        splitted1 = DatastoreInputReader._split_input_from_params(app, kind1, params, shard_count_sqrt)
        splitted2 = DatastoreInputReader._split_input_from_params(app, kind2, params, shard_count_sqrt)
        inputs = []

        for u in splitted1:
            for e in splitted2:
                inputs.append(TwoKindsInputReader(u, e))

        #mapper_spec.shard_count = len(inputs) #uncomment this in case of "Incorrect number of shard states" (at line 408 in handlers.py)
        return inputs

    @classmethod
    def validate(cls, mapper_spec):
        return True #TODO

当您需要处理两种实体的所有组合时，应使用此代码。您也可以将此代码推广到两种以上的实体。在

这是一个有效的地图还原.yaml对于TwoKindsInputReader：

^{pr2}$

网友

2楼 · 编辑于 2024-06-12 12:25:37

如果没有更详细的计算结果，很难知道推荐什么。一个简单的选择是简单地在map调用中获取相关的实体—没有什么可以阻止您在那里执行数据存储操作。在

不过，这会导致很多小电话。正如您所建议的那样，编写一个定制的InputReader将允许您并行获取两组实体，这将显著提高性能。在

如果您提供更多关于如何加入这些实体的详细信息，我们可能会提供更具体的建议。在

相关问题更多 >

编程相关推荐

热门问题

热门文章