凯拉斯：如何保存模型并继续训练？问题的回答

凯拉斯：如何保存模型并继续训练？

回答此问题可获得 20 贡献值，回答如果被采纳可获得 50 分。

我有一个模型，我已经训练了40个时代。我为每个时代保留了检查点，还用<code>model.save()</code>保存了模型。训练代码是 <pre><code>n_units = 1000 model = Sequential() model.add(LSTM(n_units, input_shape=(None, vec_size), return_sequences=True)) model.add(Dropout(0.2)) model.add(LSTM(n_units, return_sequences=True)) model.add(Dropout(0.2)) model.add(LSTM(n_units)) model.add(Dropout(0.2)) model.add(Dense(vec_size, activation='linear')) model.compile(loss='mean_squared_error', optimizer='adam') # define the checkpoint filepath="word2vec-{epoch:02d}-{loss:.4f}.hdf5" checkpoint = ModelCheckpoint(filepath, monitor='loss', verbose=1, save_best_only=True, mode='min') callbacks_list = [checkpoint] # fit the model model.fit(x, y, epochs=40, batch_size=50, callbacks=callbacks_list) </code></pre> 然而，当装载模型并再次训练时，它会像以前没有训练过一样从头开始。输球不是从上次训练开始的。 让我困惑的是，当我用重新定义的模型结构和<code>load_weight</code>加载模型时，<code>model.predict()</code>工作得很好。因此，我相信模型权重是加载的。 <pre><code>model = Sequential() model.add(LSTM(n_units, input_shape=(None, vec_size), return_sequences=True)) model.add(Dropout(0.2)) model.add(LSTM(n_units, return_sequences=True)) model.add(Dropout(0.2)) model.add(LSTM(n_units)) model.add(Dropout(0.2)) model.add(Dense(vec_size, activation='linear')) filename = "word2vec-39-0.0027.hdf5" model.load_weights(filename) model.compile(loss='mean_squared_error', optimizer='adam') </code></pre> 但是，当我继续训练 <pre><code>filepath="word2vec-{epoch:02d}-{loss:.4f}.hdf5" checkpoint = ModelCheckpoint(filepath, monitor='loss', verbose=1, save_best_only=True, mode='min') callbacks_list = [checkpoint] # fit the model model.fit(x, y, epochs=40, batch_size=50, callbacks=callbacks_list) </code></pre> 损失和初始状态一样高。 我搜索并找到了一些保存和加载模型的示例： <a href="http://machinelearningmastery.com/save-load-keras-deep-learning-models/" rel="noreferrer">http://machinelearningmastery.com/save-load-keras-deep-learning-models/</a> <a href="https://github.com/fchollet/keras/issues/1872" rel="noreferrer">https://github.com/fchollet/keras/issues/1872</a> 但都不管用。有人能帮我吗？谢谢。 更新 <a href="https://stackoverflow.com/questions/42666046/loading-a-trained-keras-model-and-continue-training">Loading a trained Keras model and continue training</a> 我试过了 <pre><code>model.save('partly_trained.h5') del model load_model('partly_trained.h5') </code></pre> 它起作用了。但当我关闭python时，重新打开并再次<code>load_model</code>。它失败了。损失和初始状态一样高。 更新 我试过于洋的示例代码。它起作用了。但回到我的代码，我还是失败了。这是最初的训练。第二个纪元应该以损失=3.1开始。 <pre><code>13700/13846 [============================>.] - ETA: 0s - loss: 3.0519 13750/13846 [============================>.] - ETA: 0s - loss: 3.0511 13800/13846 [============================>.] - ETA: 0s - loss: 3.0512Epoch 00000: loss improved from inf to 3.05101, saving model to LPT-00-3.0510.h5 13846/13846 [==============================] - 81s - loss: 3.0510 Epoch 2/60 50/13846 [..............................] - ETA: 80s - loss: 3.1754 100/13846 [..............................] - ETA: 78s - loss: 3.1174 150/13846 [..............................] - ETA: 78s - loss: 3.0745 </code></pre> 我关闭了Python并重新打开它。使用<code>model = load_model("LPT-00-3.0510.h5")</code>加载模型，然后使用 <pre><code>filepath="LPT-{epoch:02d}-{loss:.4f}.h5" checkpoint = ModelCheckpoint(filepath, monitor='loss', verbose=1, save_best_only=True, mode='min') callbacks_list = [checkpoint] # fit the model model.fit(x, y, epochs=60, batch_size=50, callbacks=callbacks_list) </code></pre> 损失从4.54开始。 <pre><code>Epoch 1/60 50/13846 [..............................] - ETA: 162s - loss: 4.5451 100/13846 [..............................] - ETA: 113s - loss: 4.3835 </code></pre>

0 条评论
分类：Python问答

默认排序时间排序

1 个回答

匿名 1天前

　擅长：python、mysql、java

由于很难弄清楚问题所在，我从您的代码中创建了一个玩具示例，它看起来工作正常。 <pre><code>import numpy as np from numpy.testing import assert_allclose from keras.models import Sequential, load_model from keras.layers import LSTM, Dropout, Dense from keras.callbacks import ModelCheckpoint vec_size = 100 n_units = 10 x_train = np.random.rand(500, 10, vec_size) y_train = np.random.rand(500, vec_size) model = Sequential() model.add(LSTM(n_units, input_shape=(None, vec_size), return_sequences=True)) model.add(Dropout(0.2)) model.add(LSTM(n_units, return_sequences=True)) model.add(Dropout(0.2)) model.add(LSTM(n_units)) model.add(Dropout(0.2)) model.add(Dense(vec_size, activation='linear')) model.compile(loss='mean_squared_error', optimizer='adam') # define the checkpoint filepath = "model.h5" checkpoint = ModelCheckpoint(filepath, monitor='loss', verbose=1, save_best_only=True, mode='min') callbacks_list = [checkpoint] # fit the model model.fit(x_train, y_train, epochs=5, batch_size=50, callbacks=callbacks_list) # load the model new_model = load_model("model.h5") assert_allclose(model.predict(x_train), new_model.predict(x_train), 1e-5) # fit the model checkpoint = ModelCheckpoint(filepath, monitor='loss', verbose=1, save_best_only=True, mode='min') callbacks_list = [checkpoint] new_model.fit(x_train, y_train, epochs=5, batch_size=50, callbacks=callbacks_list) </code></pre> 模型加载后，损失继续减小。（重启python也没有问题） <pre><code>Using TensorFlow backend. Epoch 1/5 500/500 [==============================] - 2s - loss: 0.3216 Epoch 00000: loss improved from inf to 0.32163, saving model to model.h5 Epoch 2/5 500/500 [==============================] - 0s - loss: 0.2923 Epoch 00001: loss improved from 0.32163 to 0.29234, saving model to model.h5 Epoch 3/5 500/500 [==============================] - 0s - loss: 0.2542 Epoch 00002: loss improved from 0.29234 to 0.25415, saving model to model.h5 Epoch 4/5 500/500 [==============================] - 0s - loss: 0.2086 Epoch 00003: loss improved from 0.25415 to 0.20860, saving model to model.h5 Epoch 5/5 500/500 [==============================] - 0s - loss: 0.1725 Epoch 00004: loss improved from 0.20860 to 0.17249, saving model to model.h5 Epoch 1/5 500/500 [==============================] - 0s - loss: 0.1454 Epoch 00000: loss improved from inf to 0.14543, saving model to model.h5 Epoch 2/5 500/500 [==============================] - 0s - loss: 0.1289 Epoch 00001: loss improved from 0.14543 to 0.12892, saving model to model.h5 Epoch 3/5 500/500 [==============================] - 0s - loss: 0.1169 Epoch 00002: loss improved from 0.12892 to 0.11694, saving model to model.h5 Epoch 4/5 500/500 [==============================] - 0s - loss: 0.1097 Epoch 00003: loss improved from 0.11694 to 0.10971, saving model to model.h5 Epoch 5/5 500/500 [==============================] - 0s - loss: 0.1057 Epoch 00004: loss improved from 0.10971 to 0.10570, saving model to model.h5 </code></pre> 顺便说一下，重新定义后面跟着<code>load_weight()</code>的模型肯定行不通，因为<code>save_weight()</code>和<code>load_weight()</code>不会保存/加载优化器。

凯拉斯：如何保存模型并继续训练？

1 个回答

相关Python问题