x = u'\U0001f604abc'
print('length:',len(x))
for i in x:
print(i)
得到输出:
('length:', 5)
�
�
a
b
c
x 是 4 个字符,其中第一个是 4 字节字符,一个笑脸表情的 unicdoe 码,现在显然被拆分成了两个。我写的过滤函数就过滤失败了:
def filter_invalid_str(text):
return ''.join(map(lambda x: x if u'\u0000' < x < u'\uFFFF' else '_', text))
所以,明明一个字符为什么变成了两个,如何当作一个字符处理?
这是一个专为移动设备优化的页面(即为了让你能够在 Google 搜索结果里秒开这个页面),如果你希望参与 V2EX 社区的讨论,你可以继续到 V2EX 上打开本讨论主题的完整版本。
V2EX 是创意工作者们的社区,是一个分享自己正在做的有趣事物、交流想法,可以遇见新朋友甚至新机会的地方。
V2EX is a community of developers, designers and creative people.