Skip to content

Commit 648faa9

Browse files
romanlutzCopilot
andauthored
FEAT: Backfill class-level metadata for all remote seed datasets (#1780)
Co-authored-by: Copilot <223556219+Copilot@users.noreply.github.com>
1 parent 76aff48 commit 648faa9

41 files changed

Lines changed: 357 additions & 49 deletions

Some content is hidden

Large Commits have some content hidden by default. Use the searchbox below for content that may be hidden.

pyrit/datasets/seed_datasets/remote/aegis_ai_content_safety_dataset.py

Lines changed: 6 additions & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -9,7 +9,7 @@
99
from pyrit.datasets.seed_datasets.remote.remote_dataset_loader import (
1010
_RemoteDatasetLoader,
1111
)
12-
from pyrit.models import SeedDataset, SeedPrompt
12+
from pyrit.models import Modality, SeedDataset, SeedPrompt
1313

1414
logger = logging.getLogger(__name__)
1515

@@ -60,6 +60,11 @@ class _AegisContentSafetyDataset(_RemoteDatasetLoader):
6060
"Violence",
6161
]
6262

63+
# Metadata
64+
modalities: tuple[Modality, ...] = (Modality.TEXT,)
65+
size: str = "huge" # 19093 annotated human-LLM interactions
66+
tags: frozenset[str] = frozenset({"default", "safety"})
67+
6368
def __init__(
6469
self,
6570
*,

pyrit/datasets/seed_datasets/remote/aya_redteaming_dataset.py

Lines changed: 6 additions & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -8,7 +8,7 @@
88
from pyrit.datasets.seed_datasets.remote.remote_dataset_loader import (
99
_RemoteDatasetLoader,
1010
)
11-
from pyrit.models import SeedDataset, SeedPrompt
11+
from pyrit.models import Modality, SeedDataset, SeedPrompt
1212

1313
logger = logging.getLogger(__name__)
1414

@@ -39,6 +39,11 @@ class _AyaRedteamingDataset(_RemoteDatasetLoader):
3939
"Tagalog": "tgl",
4040
}
4141

42+
# Metadata
43+
modalities: tuple[Modality, ...] = (Modality.TEXT,)
44+
size: str = "medium" # 987 prompts across multiple languages
45+
tags: frozenset[str] = frozenset({"safety", "multilingual"})
46+
4247
def __init__(
4348
self,
4449
*,

pyrit/datasets/seed_datasets/remote/babelscape_alert_dataset.py

Lines changed: 6 additions & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -7,7 +7,7 @@
77
from pyrit.datasets.seed_datasets.remote.remote_dataset_loader import (
88
_RemoteDatasetLoader,
99
)
10-
from pyrit.models import SeedDataset, SeedPrompt
10+
from pyrit.models import Modality, SeedDataset, SeedPrompt
1111

1212
logger = logging.getLogger(__name__)
1313

@@ -23,6 +23,11 @@ class _BabelscapeAlertDataset(_RemoteDatasetLoader):
2323
Reference: [@tedeschi2024alert]
2424
"""
2525

26+
# Metadata
27+
modalities: tuple[Modality, ...] = (Modality.TEXT,)
28+
size: str = "huge" # 30968 prompts (default config)
29+
tags: frozenset[str] = frozenset({"default", "safety", "jailbreak"})
30+
2631
def __init__(
2732
self,
2833
*,

pyrit/datasets/seed_datasets/remote/beaver_tails_dataset.py

Lines changed: 6 additions & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -6,7 +6,7 @@
66
from pyrit.datasets.seed_datasets.remote.remote_dataset_loader import (
77
_RemoteDatasetLoader,
88
)
9-
from pyrit.models import SeedDataset, SeedPrompt
9+
from pyrit.models import Modality, SeedDataset, SeedPrompt
1010

1111
logger = logging.getLogger(__name__)
1212

@@ -31,6 +31,11 @@ class _BeaverTailsDataset(_RemoteDatasetLoader):
3131

3232
HF_DATASET_NAME: str = "PKU-Alignment/BeaverTails"
3333

34+
# Metadata
35+
modalities: tuple[Modality, ...] = (Modality.TEXT,)
36+
size: str = "huge" # 166382 annotated prompt-response entries (default config)
37+
tags: frozenset[str] = frozenset({"default", "safety"})
38+
3439
def __init__(
3540
self,
3641
*,

pyrit/datasets/seed_datasets/remote/cbt_bench_dataset.py

Lines changed: 6 additions & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -7,7 +7,7 @@
77
from pyrit.datasets.seed_datasets.remote.remote_dataset_loader import (
88
_RemoteDatasetLoader,
99
)
10-
from pyrit.models import SeedDataset, SeedPrompt
10+
from pyrit.models import Modality, SeedDataset, SeedPrompt
1111

1212
logger = logging.getLogger(__name__)
1313

@@ -28,6 +28,11 @@ class _CBTBenchDataset(_RemoteDatasetLoader):
2828
- [@zhang2024cbtbench]
2929
"""
3030

31+
# Metadata
32+
modalities: tuple[Modality, ...] = (Modality.TEXT,)
33+
size: str = "small" # 20 core_fine_seed therapy seeds (default config)
34+
tags: frozenset[str] = frozenset({"safety", "medical"})
35+
3136
def __init__(
3237
self,
3338
*,

pyrit/datasets/seed_datasets/remote/ccp_sensitive_prompts_dataset.py

Lines changed: 6 additions & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -6,7 +6,7 @@
66
from pyrit.datasets.seed_datasets.remote.remote_dataset_loader import (
77
_RemoteDatasetLoader,
88
)
9-
from pyrit.models import SeedDataset, SeedPrompt
9+
from pyrit.models import Modality, SeedDataset, SeedPrompt
1010

1111
logger = logging.getLogger(__name__)
1212

@@ -21,6 +21,11 @@ class _CCPSensitivePromptsDataset(_RemoteDatasetLoader):
2121
Reference: [@promptfoo2025ccp]
2222
"""
2323

24+
# Metadata
25+
modalities: tuple[Modality, ...] = (Modality.TEXT,)
26+
size: str = "large" # 1360 censorship-sensitive prompts (single-language Mandarin)
27+
tags: frozenset[str] = frozenset({"safety", "multilingual"})
28+
2429
def __init__(
2530
self,
2631
*,

pyrit/datasets/seed_datasets/remote/coconot_dataset.py

Lines changed: 1 addition & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -285,7 +285,7 @@ class _CoCoNotContrastDataset(_CoCoNotBaseDataset):
285285
CONFIG: str = "contrast"
286286
SPLITS: tuple[str, ...] = ("test",)
287287
size: str = "medium"
288-
tags: set[str] = set()
288+
tags: set[str] = {"safety", "refusal"}
289289
DEFAULT_DESCRIPTION: str = (
290290
"CoCoNot contrast set — 379 benign prompts that look superficially similar to "
291291
"refusal-target prompts but should be complied with. Used to measure "

pyrit/datasets/seed_datasets/remote/comic_jailbreak_dataset.py

Lines changed: 3 additions & 3 deletions
Original file line numberDiff line numberDiff line change
@@ -12,7 +12,7 @@
1212
from pyrit.datasets.seed_datasets.remote.remote_dataset_loader import (
1313
_RemoteDatasetLoader,
1414
)
15-
from pyrit.models import Seed, SeedDataset, SeedObjective, SeedPrompt
15+
from pyrit.models import Modality, Seed, SeedDataset, SeedObjective, SeedPrompt
1616

1717
logger = logging.getLogger(__name__)
1818

@@ -92,8 +92,8 @@ class _ComicJailbreakDataset(_RemoteDatasetLoader):
9292
"sexual",
9393
"privacy",
9494
)
95-
modalities: tuple[str, ...] = ("text", "image")
96-
size: str = "large" # 300 goals × 5 templates
95+
modalities: tuple[Modality, ...] = (Modality.TEXT, Modality.IMAGE)
96+
size: str = "large" # 3501 image-text jailbreak prompts
9797
tags: frozenset[str] = frozenset({"safety", "multimodal"})
9898

9999
def __init__(

pyrit/datasets/seed_datasets/remote/darkbench_dataset.py

Lines changed: 6 additions & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -4,7 +4,7 @@
44
from pyrit.datasets.seed_datasets.remote.remote_dataset_loader import (
55
_RemoteDatasetLoader,
66
)
7-
from pyrit.models import SeedDataset, SeedPrompt
7+
from pyrit.models import Modality, SeedDataset, SeedPrompt
88

99

1010
class _DarkBenchDataset(_RemoteDatasetLoader):
@@ -23,6 +23,11 @@ class _DarkBenchDataset(_RemoteDatasetLoader):
2323
- https://openreview.net/forum?id=odjMSBSWRt
2424
"""
2525

26+
# Metadata
27+
modalities: tuple[Modality, ...] = (Modality.TEXT,)
28+
size: str = "large" # 660 prompts across 6 dark-pattern categories
29+
tags: frozenset[str] = frozenset({"default", "safety"})
30+
2631
def __init__(
2732
self,
2833
*,

pyrit/datasets/seed_datasets/remote/equitymedqa_dataset.py

Lines changed: 6 additions & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -8,7 +8,7 @@
88
from pyrit.datasets.seed_datasets.remote.remote_dataset_loader import (
99
_RemoteDatasetLoader,
1010
)
11-
from pyrit.models import SeedDataset, SeedPrompt
11+
from pyrit.models import Modality, SeedDataset, SeedPrompt
1212

1313
logger = logging.getLogger(__name__)
1414

@@ -24,6 +24,11 @@ class _EquityMedQADataset(_RemoteDatasetLoader):
2424
Reference: [@pfohl2024equitymedqa]
2525
"""
2626

27+
# Metadata
28+
modalities: tuple[Modality, ...] = (Modality.TEXT,)
29+
size: str = "huge" # 5565 prompts across 11 medical-bias subsets
30+
tags: frozenset[str] = frozenset({"safety", "bias", "medical"})
31+
2732
DATA_SUBSETS: list[str] = [
2833
"cc_llm",
2934
"cc_manual",

0 commit comments

Comments
 (0)