题目
DNA序列 由一系列核苷酸组成,缩写为 'A'
, 'C'
, 'G'
和 'T'
.。
- 例如,
"ACGAATTCCG"
是一个 DNA序列 。
在研究 DNA 时,识别 DNA 中的重复序列非常有用。
给定一个表示 DNA序列 的字符串 s
,返回所有在 DNA 分子中出现不止一次的 长度为 10
的序列(子字符串)。你可以按 任意顺序 返回答案。
示例 1:
输入:s = "AAAAACCCCCAAAAACCCCCCAAAAAGGGTTT"
输出:["AAAAACCCCC","CCCCCAAAAA"]
示例 2:
输入:s = "AAAAAAAAAAAAA"
输出:["AAAAAAAAAA"]
思路:
使用了两个集合,一个用于存储当前循环中的DNA子序列,另一个用于存储重复出现的子序列。通过遍历输入字符串,逐个检查子序列是否在集合中出现,最终找出所有重复的DNA子序列。
class Solution { public List<String> findRepeatedDnaSequences(String s) { int len=s.length(); Set<String> res = new HashSet<>(); Set<String> set = new HashSet<>(); for(int i=0;i<=len-10;i++){ String key=s.substring(i,i+10); if(set.contains(key)){ res.add(key); }else{ set.add(key); } } return new ArrayList<>(res); } }