tf.contrib.legacy_seq2seq.embedding_rnn_seq2seq的官方文档对output_projection参数有以下解释:
output_projection:没有或一对output_size x num_decoder_symbols,而B具有shape num_decoder_symbols;如果提供和feed_previous=True,则每个馈送的先前输出将首先乘以我不明白为什么B参数应该有[num_decoder_symbols]的大小?由于输出首先乘以W,然后将偏差相加,它不应