Hugging Face
Models
Datasets
Spaces
Buckets
new
Docs
Enterprise
Pricing
Website
Tasks
HuggingChat
Collections
Languages
Organizations
Community
Blog
Posts
Daily Papers
Hardware
Learn
Discord
Forum
GitHub
Solutions
Team & Enterprise
Hugging Face PRO
Enterprise Support
Inference Providers
Inference Endpoints
Storage Buckets
Log In
Sign Up
Spaces:
SabaPivot
/
repro-tau2-bench
like
0
Running
App
Files
Files
Community
main
repro-tau2-bench
659 kB
Ctrl+K
Ctrl+K
1 contributor
History:
3 commits
SabaPivot
Update logbook: Reproduction: tau2-Bench: Evaluating Conversational Agents in a Dual-Control Environment
5eed044
verified
24 days ago
pages
Update logbook: Reproduction: tau2-Bench: Evaluating Conversational Agents in a Dual-Control Environment
24 days ago
.gitattributes
Safe
1.52 kB
initial commit
27 days ago
README.md
Safe
454 Bytes
Update logbook: Reproduction: tau2-Bench: Evaluating Conversational Agents in a Dual-Control Environment
24 days ago
bucket-icon.svg
Safe
413 Bytes
Update logbook: Repro - tau2-Bench: Evaluating Conversational Agents in a Dual-Control Environment
27 days ago
index.html
Safe
1.88 kB
Update logbook: Reproduction: tau2-Bench: Evaluating Conversational Agents in a Dual-Control Environment
24 days ago
logbook.css
Safe
29.6 kB
Update logbook: Repro - tau2-Bench: Evaluating Conversational Agents in a Dual-Control Environment
27 days ago
logbook.js
Safe
77.3 kB
Update logbook: Repro - tau2-Bench: Evaluating Conversational Agents in a Dual-Control Environment
27 days ago
logbook.json
Safe
2.15 kB
Update logbook: Reproduction: tau2-Bench: Evaluating Conversational Agents in a Dual-Control Environment
24 days ago
style.css
Safe
388 Bytes
initial commit
27 days ago
trackio-logo-light.png
Safe
30 kB
Update logbook: Repro - tau2-Bench: Evaluating Conversational Agents in a Dual-Control Environment
27 days ago
trackio-logo.png
Safe
55.6 kB
Update logbook: Repro - tau2-Bench: Evaluating Conversational Agents in a Dual-Control Environment
27 days ago
trackio-wordmark-dark.png
Safe
89.8 kB
Update logbook: Repro - tau2-Bench: Evaluating Conversational Agents in a Dual-Control Environment
27 days ago