Pica ASR · Production API v6 · Enterprise Ready

ถอดเสียงพูดเป็นข้อความ
ด้วย AI ระดับ Enterprise

API ถอดเสียงความแม่นยำสูงรองรับภาษาไทย–อังกฤษ พร้อม Speaker Diarization
Noise Reduction · Streaming · ZIP Export · Multi-User · Stripe Billing

LIVE DEMO — Real Transcript Output
กำลังโหลดตัวอย่าง...
🌐 Lang: th
⚡ RTF: 0.12x
🎙 Speaker: Speaker 1
⏱ Duration: 3.2s
Cloud
Backend
0.12x
Avg RTF
4
Plans
24/7
Uptime
เลื่อนลง
🎙

Streaming Real-time

Push chunk ทีละก้อน VAD ตัดอัตโนมัติ

👥

Speaker Diarization

แยกเสียงผู้พูดหลายคน pyannote + MFCC

🔇

Noise Reduction

Spectral Subtraction ในตัว ไม่ต้อง preprocess

📦

ZIP Export ครบรูปแบบ

TXT · SRT · VTT · CSV · JSON · ZIP+Audio

0
Users ที่ใช้งาน
0
ชั่วโมงเสียงที่ถอด
0
% Uptime
0
ภาษาที่รองรับ
◆ Core Features

ฟีเจอร์ครบ พร้อมใช้งานทันที

ระบบ ASR ระดับ Enterprise พัฒนาบน AI engine ที่ทรงพลัง พร้อม infrastructure ประสิทธิภาพสูงสุด

🎙
STREAMING ASR
Push chunk ทีละก้อน ระบบ VAD ตัดประโยคอัตโนมัติ รองรับ session buffer สูงสุด 8 วินาที batch inference ด้วย AI engine ประสิทธิภาพสูง
🌐
MULTILINGUAL
รองรับภาษาไทย และอังกฤษ พร้อม Auto-detect ภาษา Hallucination filter กรอง foreign chars และ repetition อัตโนมัติ
🔇
NOISE REDUCTION
Spectral Subtraction + High-pass filter + Pre-emphasis สำหรับไฟล์ ≥2 วินาที ปรับ RMS normalize อัตโนมัติ ไม่กระทบ clarity
👥
SPEAKER DIARIZATION
pyannote/speaker-diarization-3.1 สำหรับความแม่นยำสูง หรือ MFCC Cosine Similarity fallback รองรับหลายผู้พูดพร้อมกัน
💾
AUDIO STORAGE
บันทึก WAV แต่ละ segment อัตโนมัติ จัดเก็บแยก session/user ดาวน์โหลดได้ทีละ segment หรือ bulk ZIP พร้อม audio
📦
EXPORT ทุกรูปแบบ
TXT (timestamp+speaker) · SRT · WebVTT · CSV · JSON · ZIP (รวม audio) ครบทุก format สำหรับ subtitle editing และ analytics
🔐
JWT + API KEY AUTH
ล็อกอินด้วย JWT หรือ API Key สูงสุด 10 keys/user Rate limiting sliding-window ต่อ user ตาม plan blacklist JWT on logout
🔗
WEBHOOKS
ส่ง event ทุก transcript ไปยัง URL ที่กำหนด พร้อม HMAC-SHA256 signature รองรับ 1–20 webhooks ต่อ plan
💳
STRIPE BILLING
Subscription (Pro/Enterprise) + One-time credit packs Checkout · Portal · Webhook · Refund · Payment history ครบ
📊
ADMIN DASHBOARD
สถิติผู้ใช้ รายได้ disk usage Model metrics จัดการ user/session/credit ดาวน์โหลด bulk ZIP export ทุก session
🔴
REDIS MONITOR
Dashboard Redis แบบ realtime — INFO · Queues · PubSub · Key Browser · Memory Doctor · Execute safe commands
HIGH-PERF ENGINE
Batch inference สูงสุด 32 · Queue capacity 200 requests · Latency ต่ำมาก ระบบ fallback อัตโนมัติเมื่อโหลดสูง
◆ API Reference

Endpoints พร้อมใช้งาน

RESTful API รองรับ multipart/form-data และ JSON พร้อม Swagger UI ที่ /docs

POST/push_chunk
ส่ง audio chunk เข้า session buffer ระบบจะตัดและถอดเสียงอัตโนมัติเมื่อ VAD ตรวจพบจุดหยุด
ASR · Streaming
POST/flush_session
บังคับ flush buffer ที่เหลือใน session ใช้เมื่อสิ้นสุดการบันทึก
ASR · Session
POST/transcribe
อัปโหลดไฟล์เสียงเต็ม ถอดเสียงครั้งเดียว รองรับ MP3, WAV, WEBM, M4A สูงสุด 50MB
ASR · Upload
GET/sessions/{id}/export
Export transcript — fmt: txt | srt | vtt | csv | json | zip (รวม audio WAV ต่อ segment)
Export · ZIP
POST/auth/login
รับ JWT token — ใช้ username หรือ email ได้ทั้งคู่
Auth
GET/health
สถานะระบบ — model ready, backend mode, queue depth, active sessions
System
PYTHON · QUICK START
# 1. Login & get token
import requests

res = requests.post("/auth/login", data={
    "username": "your_username",
    "password": "your_password"
})
token = res.json()["access_token"]
headers = {"Authorization": f"Bearer {token}"}

# 2. Upload & transcribe
with open("audio.wav", "rb") as f:
    r = requests.post("/transcribe",
        files={"file": f},
        data={"language": "th"},
        headers=headers
    )

result = r.json()
print(result["text"])
# → "สวัสดีครับ ยินดีต้อนรับ"
print(f"RTF: {result['rtf']}x")
print(f"Speaker: {result['speaker_id']}")

# 3. Export as ZIP with audio
sid = result["session_id"]
zip_r = requests.get(
    f"/sessions/{sid}/export?fmt=zip",
    headers=headers
)
with open("output.zip", "wb") as f:
    f.write(zip_r.content)
◆ Why Pica

ทำไมต้องเลือก Pica?

ออกแบบมาสำหรับ Production ตั้งแต่วันแรก ไม่ใช่แค่ demo

01
RTF ต่ำกว่า 0.15x
Real-Time Factor ต่ำสุดใน class เดียวกัน เสียง 10 วินาที ถอดเสร็จใน 1.5 วินาที ด้วย AI inference engine ที่ออพติไมซ์แล้ว
02 🏗️
Multi-User พร้อม Billing
JWT Auth · API Keys · Plans (Free/Lite/Pro/Enterprise) · Credit packs · Stripe integration ครบ ไม่ต้องพัฒนา billing เอง
03 🔒
Data Ownership 100%
ติดตั้งบน Server ของคุณเอง เสียงและ transcript เก็บใน local filesystem ไม่มีข้อมูลส่งออกไปภายนอก รองรับ On-Premise
◆ Pricing

เลือกแผนที่เหมาะกับคุณ

ทุกแผนรวม Audio Storage และ Speaker Diarization ไม่มีค่าใช้จ่ายซ่อนเร้น

Free
$0/เดือน
เริ่มต้นได้ทันที ไม่ต้องใส่บัตร
  • 60 นาที/เดือน
  • Upload สูงสุด 25 MB
  • Export: TXT, JSON, ZIP
  • Webhook 1 จุด
  • Rate limit 30 req/min
  • Audio Storage
  • Speaker Diarization
เริ่มต้นฟรี
Lite
$10/เดือน
สำหรับทีมขนาดเล็ก
  • 600 นาที/เดือน (10 ชม.)
  • Upload สูงสุด 50 MB
  • Export: TXT, JSON, SRT, VTT, CSV, ZIP
  • Webhook 5 จุด
  • Rate limit 120 req/min
  • Audio Storage + ZIP Export
  • Priority Support
Upgrade to Lite
Enterprise
$49/เดือน
สำหรับองค์กรขนาดใหญ่
  • 3600 นาที/เดือน (60 ชม.)
  • Upload สูงสุด 300 MB
  • Export ครบทุกรูปแบบ
  • Webhook 20 จุด
  • Rate limit 600 req/min
  • Dedicated Support + SLA
  • On-Premise deployment
Contact Sales
◆ Credit Packs

ซื้อเพิ่มตามต้องการ

ไม่ต้อง Upgrade plan — เติม credit เมื่อโควต้าหมด

STARTER
100 min
$5 USD
Buy Pack
BULK
2000 min
$60 USD
Buy Pack
◆ Get Started Today

พร้อมถอดเสียงแล้วหรือยัง?

สมัครฟรี ไม่ต้องใส่บัตรเครดิต ได้ 60 นาที/เดือนทันที
รองรับ Thai · English · Auto-detect