过滤

屏蔽给定的字符串值。 这对于创建已删除敏感信息的表副本非常有用。

有关相应的 Databricks SQL 函数,请参阅 mask 函数。

Syntax

from pyspark.sql import functions as dbf

dbf.mask(col=<col>, upperChar=<upperChar>, lowerChar=<lowerChar>, digitChar=<digitChar>, otherChar=<otherChar>)

参数

参数 类型 Description
col pyspark.sql.Column 或 str 要计算的目标列。
upperChar pyspark.sql.Column 或 str, optional 将大写字符替换为的字符。 指定 NULL 以保留原始字符。
lowerChar pyspark.sql.Column 或 str, optional 将小写字符替换为的字符。 指定 NULL 以保留原始字符。
digitChar pyspark.sql.Column 或 str, optional 要替换为数字字符的字符。 指定 NULL 以保留原始字符。
otherChar pyspark.sql.Column 或 str, optional 将所有其他字符替换为的字符。 指定 NULL 以保留原始字符。

退货

pyspark.sql.Column:

例子

df = spark.createDataFrame([("AbCD123-@$#",), ("abcd-EFGH-8765-4321",)], ['data'])
df.select(mask(df.data).alias('r')).collect()
df.select(mask(df.data, lit('Y')).alias('r')).collect()
df.select(mask(df.data, lit('Y'), lit('y')).alias('r')).collect()
df.select(mask(df.data, lit('Y'), lit('y'), lit('d')).alias('r')).collect()
df.select(mask(df.data, lit('Y'), lit('y'), lit('d'), lit('*')).alias('r')).collect()