问题描述
1 term_map
跟踪哪个术语位于哪个位置。
In [256]: term_map = np.array([2, 2, 3, 4, 4, 4, 2, 0, 0, 0])
In [257]: term_map
Out[257]: array([2, 2, 3, 4, 4, 4, 2, 0, 0, 0])
2 term_scores
跟踪每个位置上每个术语的权重。
In [258]: term_scores = np.array([5, 6, 9, 8, 9, 4, 5, 1, 2, 1])
In [259]: term_scores
Out[259]: array([5, 6, 9, 8, 9, 4, 5, 1, 2, 1])
3获取唯一值和反索引。
In [260]: unqID, idx = np.unique(term_map, return_inverse=True)
In [261]: unqID
Out[261]: array([0, 2, 3, 4])
4计算唯一值的分数。
In [262]: value_sums = np.bincount(idx, term_scores)
In [263]: value_sums
Out[263]: array([ 4., 16., 9., 21.])
5初始化要更新的阵列。
索引对应于term_map
变量中的值。
In [254]: vocab = np.zeros(13)
In [255]: vocab
Out[255]: array([ 0., 0., 0., 0., 0., 0., 0., 0., 0., 0., 0., 0., 0.])
6期望:将与3中列出的位置相对应的值4插入vocab
变量中。
In [255]: updated_vocab
Out[255]: array([ 4., 0., 16., 9., 21., 0., 0., 0., 0., 0., 0., 0., 0.])
如何创建6?
1楼
事实证明,我们能够避免np.unique
步骤,通过在进料直接得到所需的输出term_map
和term_scores
到np.bincount
并且还提到与它的可选参数的输出阵列的长度minlength
。
因此,我们可以简单地-
final_output = np.bincount(term_map, term_scores, minlength=13)
样品运行-
In [142]: term_map = np.array([2, 2, 3, 4, 4, 4, 2, 0, 0, 0])
...: term_scores = np.array([5, 6, 9, 8, 9, 4, 5, 1, 2, 1])
...:
In [143]: np.bincount(term_map, term_scores, minlength=13)
Out[143]:
array([ 4., 0., 16., 9., 21., 0., 0., 0., 0., 0., 0.,
0., 0.])
2楼
import numpy as np
term_map = np.array([2, 2, 3, 4, 4, 4, 2, 0, 0, 0])
term_scores = np.array([5, 6, 9, 8, 9, 4, 5, 1, 2, 1])
unqID, idx = np.unique(term_map, return_inverse=True)
value_sums = np.bincount(idx, term_scores)
vocab = np.zeros(13)
vocab[unqID] = value_sums
print(vocab)
OUT: [ 4. 0. 16. 9. 21. 0. 0. 0. 0. 0. 0. 0. 0.]